热点事件持续更新
Legal Research Bench:长程法律研究代理端到端可靠性基准
2 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026-10-02,arXiv 发布论文 Legal Research Bench,构建包含 413 道专家撰写的开放性美国法律研究问题的基准,每题配标准答案、支持依据与二元评分标准。实验评估 13 个前沿模型,最强模型 Claude Opus 4.8 完全正确率仅 42.9%,且更多轮次、工具调用与推理成本并不能预测更高准确率。同日另一篇 arXiv 论文提出面向科学 AI 的本体锚定推理评估基准,与本事件无关。
AI 根据报道生成 · 1 小时前更新
事件进展
2 个进展
- 10月2日 12:00 · 1 篇报道Legal Research Bench:衡量长程法律研究代理的端到端可靠性arXiv · Artificial Intelligence:Legal Research Bench:衡量长程法律研究智能体的端到端可靠性
- 10月2日 12:00 · 1 篇报道Ontology-Grounded Reasoner-Verified Benchmarks for LLM ScienarXiv · Artificial Intelligence:面向科学 AI 中 LLM 推理评估的本体锚定、推理器验证基准
报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv · Artificial Intelligence面向科学 AI 中 LLM 推理评估的本体锚定、推理器验证基准
该研究提出从 OWL 2 本体自动生成多选题基准的流水线,正确答案由本体锚定,干扰项通过 OWL 推理器形式化验证。在 Pizza(112 题)、PMDco(2,491 题)和 DOID(15,216 题)三个本体上生成基准,6 个 LLM 零样本准确率为 41.1%-76.8%,显著高于 25% 随机基线。
- arXiv · Artificial Intelligence精选Legal Research Bench:衡量长程法律研究智能体的端到端可靠性
论文提出 Legal Research Bench,包含 413 道专家撰写的开放性美国法律研究问题,每题配有标准答案、支持依据和二元评分标准。实验评估了 13 个前沿模型,最强模型 Claude Opus 4.8 完全正确率仅 42.9%,且更多轮次、工具调用和推理成本并不能预测更高准确率。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。