跳到正文
原文
arXiv · Machine Learning Theory· Erik Skalnes, Layne C. Price, Raviteja Anantha, Michael Oberst·· 3 小时前AI 评分41

用干预迁移评估评分准则生成

Evaluating Rubric Generation with Interventional Transfer

AI 导读

论文提出干预迁移(IT)方法评估 LLM 生成的评分准则:若两条准则在响应被扰动为通过/失败其中一条时同步变化,则二者相似。在 HealthBench 案例中,Qwen3.8-27B、Deepseek-V4-Flash 与 Opus-5 生成的准则用于评估 GPT-5.6-Terra 的响应;降低响应的扰动可迁移到另一准则的更低分,但提升扰动不能可靠迁移到更高分,呈现不对称性。

来源:arXiv · Machine Learning Theory · arxiv.org