PFaithBench:LLM 忠实度成对上下文基准发布
Get the story
2026年10月7日,arXiv Computation and Language 刊登一手研究《重新思考 LLM 忠实性:成对上下文敏感视角》,提出成对忠实性基准 PFaithBench,用于评估模型在支持性与不支持性上下文下对同一问题在作答与拒答之间切换的能力。评测覆盖 7 个模型家族的 39 个模型,结果显示多数模型偏向作答,忠实性错误主要来自过度作答;增加作答监督数据会加剧过度作答,增加拒答数据则减少幻觉但导致过度拒答。研究方称代码与数据已开源。
Generated from reports · updated 3 hr ago
Timeline
Follow the coverage from different angles.
- arXiv · Computation and Language重新思考 LLM 忠实性:成对上下文敏感视角
研究提出成对忠实性基准 PFaithBench,评估模型能否在支持性与不支持性上下文下对同一问题在作答与拒答之间切换。评测覆盖 7 个模型家族的 39 个模型,发现多数模型偏向作答,忠实性错误主要来自过度作答;增加作答监督数据会加剧过度作答,增加拒答数据则减少幻觉但导致过度拒答。代码与数据已开源。
Heat trend
Current heat 9·Comparable peak 10(Oct 7)·Comparable change over 24 hours –
The trend compares only the same participants observed continuously; its range may be smaller than the current heat count. Move or click on the chart to inspect hourly heat; use the left and right arrow keys to switch.