Hot eventLive
线性奖励对齐公理可满足性研究
1 reports1 sources3 hr ago updated
Get the story
AI overview
2026年10月7日,arXiv Multiagent Systems 发布一手论文,研究线性奖励在对齐中满足 PO 与 PMC 公理的代价。论文允许每个候选项带松弛量,并以间隔 η 计算满足公理的最小总松弛;在 η 至多为 O(1/m²) 时,最优总松弛被界为 O(1),并给出迫使该界成立的实例,证明该速率在常数因子内紧致。此外,作者提出对线性奖励判错的比较收费的新方法,用参数 λ 在总松弛与违例数之间权衡,实验显示其输出的线性奖励优于线性 BTL。
Generated from reports · updated 3 hr ago
Timeline
Follow the coverage from different angles.
Oct 7, 2026
- arXiv · Multiagent Systems线性奖励的对齐公理可满足性
论文研究线性奖励在对齐中满足 PO 与 PMC 公理的代价,允许每个候选项带松弛量,并以间隔 η 计算满足公理的最小总松弛。在 η 至多为 O(1/m²) 时,最优总松弛被界为 O(1),并给出迫使该界成立的实例,证明速率在常数因子内紧致。作者还提出对线性奖励判错的比较收费的新方法,用参数 λ 在总松弛与违例数之间权衡,实验显示其输出的线性奖励优于线性 BTL。
Heat trend
There is not enough continuous observation data to draw a trend yet.