arXiv · Computation and Language· Chenguang Wang, Ming Li, Chengrui Fan, Jianpeng Chen, Han Chen, Tianyi Zhou, Dawei Zhou·· 3 小时前AI 评分52
AI 审稿人修辞鲁棒性评测基准 RobustReview 与双分支审稿模型 SciCore
A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review
AI 导读
论文指出 AI 审稿人会对表述不同但科学内容相同的手稿给出不同判断,提出修辞鲁棒性要求稳定性与区分性兼备。研究构建包含 1,260 个版本的全文基准 RobustReview,评估 30 种审稿配置,发现低重写敏感度常伴随分数坍塌,且人类对齐与修辞鲁棒性排序不一致。
来源:arXiv · Computation and Language · arxiv.org