arXiv · Multiagent Systems· Soumya Nasipuri, Sayak Ray Chowdhury, Sanjukta Roy·· 3 小时前AI 评分29
线性奖励的对齐公理可满足性
Axiom Satisfiability of Linear Rewards in Alignment
AI 导读
论文研究线性奖励在对齐中满足 PO 与 PMC 公理的代价,允许每个候选项带松弛量,并以间隔 η 计算满足公理的最小总松弛。在 η 至多为 O(1/m²) 时,最优总松弛被界为 O(1),并给出迫使该界成立的实例,证明速率在常数因子内紧致。作者还提出对线性奖励判错的比较收费的新方法,用参数 λ 在总松弛与违例数之间权衡,实验显示其输出的线性奖励优于线性 BTL。
来源:arXiv · Multiagent Systems · arxiv.org