跳到正文
原文
arXiv · Software Engineering· Kun Liu, Liqun Chen·· 3 小时前AI 评分32

OOM-RL:面向基于 LLM 的多智能体系统的资金耗尽强化学习市场驱动对齐

OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems

AI 导读

论文提出 OOM-RL(Out-of-Money Reinforcement Learning)对齐范式,将智能体投入真实金融市场,以资金耗尽作为外部施加的负梯度,替代 RLHF / RLAIF 中易引发模型谄媚的内部评估。

来源:arXiv · Software Engineering · arxiv.org