跳到正文
原文
arXiv · Computation and Language· M. Mikail Demir, M. Abdullah Canbaz·· 3 小时前AI 评分44

PARCEL:面向法律模型幻觉检测的三分类声明级评测基准

When Citations Mislead? A Claim-Level Benchmark for Legal Hallucination Detection

AI 导读

研究者提出 PARCEL 基准,用于检验法律声明是否得到所引用判例支持。数据集基于纽约州上诉法院判决构建,含 3,396 条括号式声明,标注为 Supported、Refuted 或 Not Found,并以零样本方式评测多个 SOTA LLM。最强模型准确率达 0.97,但仍在提供完整判决书时把无支持声明误判为支持;缺失支持比直接矛盾更难识别,伪造但看似合理的引用导致性能下降最大。

来源:arXiv · Computation and Language · arxiv.org