Skip to content
arXiv · Computation and Language· Zizhuo Zhang, Xiong Peng, Jingwei Sun, Rong Yao, Borui Jiang, Bo Han·· 4 hr agoAI score41

重新思考 LLM 忠实性:成对上下文敏感视角

Rethinking Faithfulness in LLMs: A Pairwise Context-Sensitive Perspective

AI brief

研究提出成对忠实性基准 PFaithBench,评估模型能否在支持性与不支持性上下文下对同一问题在作答与拒答之间切换。评测覆盖 7 个模型家族的 39 个模型,发现多数模型偏向作答,忠实性错误主要来自过度作答;增加作答监督数据会加剧过度作答,增加拒答数据则减少幻觉但导致过度拒答。代码与数据已开源。

Source: arXiv · Computation and Language · arxiv.org