跳到正文
热点事件持续更新

PARCEL:法律幻觉检测声明级基准

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月9日,研究者在arXiv(Computation and Language)发布PARCEL基准,用于检验法律声明是否得到所引用判例支持。数据集基于纽约州上诉法院判决构建,含3,396条括号式声明,标注为Supported、Refuted或Not Found三类。研究以零样本方式评测多个SOTA LLM,最强模型准确率达0.97;但在提供完整判决书时仍会把无支持声明误判为支持。结果显示,缺失支持比直接矛盾更难识别,伪造但看似合理的引用导致性能下降最大。该基准为法律领域幻觉检测提供了声明级评测框架。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv · Computation and Language
    PARCEL:面向法律模型幻觉检测的三分类声明级评测基准

    研究者提出 PARCEL 基准,用于检验法律声明是否得到所引用判例支持。数据集基于纽约州上诉法院判决构建,含 3,396 条括号式声明,标注为 Supported、Refuted 或 Not Found,并以零样本方式评测多个 SOTA LLM。最强模型准确率达 0.97,但仍在提供完整判决书时把无支持声明误判为支持;缺失支持比直接矛盾更难识别,伪造但看似合理的引用导致性能下降最大。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。