跳到正文
原文
arXiv · Human-Computer Interaction· Mufeng Yang, Junwei Yu, Yepeng Ding·· 3 小时前AI 评分58

JuryFlow:分歧引导的人机协同多智能体评测框架

JuryFlow: Disagreement-Guided Human-in-the-Loop Multi-Agent Evaluation

AI 导读

论文提出 JuryFlow,把多法官对原子主张的分歧构建为分歧图,通过熵排序自动选择焦点主张进行最小干预重评,并将修正沿图传播、沉淀为可复用评分标准。在 MT-Bench 和 LLMBar 上自动配置下,相比单法官与多数投票基线提升了与金标的一致性,消融实验分别验证了分歧重评、传播与评分标准归纳的贡献。

来源:arXiv · Human-Computer Interaction · arxiv.org