Skip to content
arXiv · Software Engineering· Kun Liu, Liqun Chen·· 4 hr agoAI score32

OOM-RL:面向基于 LLM 的多智能体系统的资金耗尽强化学习市场驱动对齐

OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems

AI brief

论文提出 OOM-RL(Out-of-Money Reinforcement Learning)对齐范式,将智能体投入真实金融市场,以资金耗尽作为外部施加的负梯度,替代 RLHF / RLAIF 中易引发模型谄媚的内部评估。

Source: arXiv · Software Engineering · arxiv.org