Skip to content
Hot eventLive

线性奖励对齐公理可满足性研究

1 reports1 sources3 hr ago updated

Get the story

AI overview

2026年10月7日,arXiv Multiagent Systems 发布一手论文,研究线性奖励在对齐中满足 PO 与 PMC 公理的代价。论文允许每个候选项带松弛量,并以间隔 η 计算满足公理的最小总松弛;在 η 至多为 O(1/m²) 时,最优总松弛被界为 O(1),并给出迫使该界成立的实例,证明该速率在常数因子内紧致。此外,作者提出对线性奖励判错的比较收费的新方法,用参数 λ 在总松弛与违例数之间权衡,实验显示其输出的线性奖励优于线性 BTL。

Generated from reports · updated 3 hr ago

Timeline

Follow the coverage from different angles.

Oct 7, 2026
  1. arXiv · Multiagent Systems
    线性奖励的对齐公理可满足性

    论文研究线性奖励在对齐中满足 PO 与 PMC 公理的代价,允许每个候选项带松弛量,并以间隔 η 计算满足公理的最小总松弛。在 η 至多为 O(1/m²) 时,最优总松弛被界为 O(1),并给出迫使该界成立的实例,证明速率在常数因子内紧致。作者还提出对线性奖励判错的比较收费的新方法,用参数 λ 在总松弛与违例数之间权衡,实验显示其输出的线性奖励优于线性 BTL。

Heat trend

There is not enough continuous observation data to draw a trend yet.