热点事件持续更新
法律思维链忠实性反事实审计研究发布
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026年10月9日,arXiv Computers and Society 发布一项反事实审计研究(一手报道)。论文针对七款开源大语言模型(参数规模8B-70B),在四个法律推理基准(CaseHOLD、ECHR、SCOTUS、ContractNLI)上开展实验:固定案情后替换模型生成中引用的法律依据。结果显示,模型在66.7%-100%的生成中能正确命名所引用的法律依据,但判决结果随依据改变的比例较低:CaseHOLD 为0.0%-21.7%,ECHR 与 SCOTUS 为30.0%-76.7%,ContractNLI 为43.3%-50.0%。这表明模型引用的法律依据常与判决结果脱钩,即思维链中引用的依据对最终结论的忠实性有限。研究覆盖的基准与模型范围、正确命名依据的比例区间以及各基准判决随依据改变的比例区间,均以报道披露为准。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 12:00
arXiv 发布反事实审计:模型常能正确命名法律依据,但判决随依据改变比例仅0.0%-76.7%。报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv · Computers and Society反事实审计显示大语言模型引用的法律依据常与判决结果脱钩
论文对七款开源模型(8B-70B)在四个法律推理基准上做反事实审计,固定案情后替换被引用的法律依据,发现模型在66.7%-100%的生成中能正确命名依据,但判决随依据改变的比例仅0.0%-21.7%(CaseHOLD)、30.0%-76.7%(ECHR与SCOTUS)和43.3%-50.0%(ContractNLI)。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。