arXiv · Artificial Intelligence· Katrina Drozdov, Oliver Chen, Langston Nashold, Rayan Krishnan·· 3 hr agoSelectedAI score69
Legal Research Bench:衡量长程法律研究智能体的端到端可靠性
Legal Research Bench: Measuring End-to-End Reliability in Long-Horizon Legal Research Agents
AI brief
论文提出 Legal Research Bench,包含 413 道专家撰写的开放性美国法律研究问题,每题配有标准答案、支持依据和二元评分标准。实验评估了 13 个前沿模型,最强模型 Claude Opus 4.8 完全正确率仅 42.9%,且更多轮次、工具调用和推理成本并不能预测更高准确率。
Why it matters
基准揭示了法律智能体在端到端可靠性上的真实差距,读者可据此判断当前模型是否足以承担实际法律研究任务。
Source: arXiv · Artificial Intelligence · arxiv.org