Hot eventLive
Legal Research Bench:长程法律研究代理端到端可靠性基准
2 reports1 sources3 hr ago updated
Get the story
AI overview
2026-10-02,arXiv 发布论文 Legal Research Bench,构建包含 413 道专家撰写的开放性美国法律研究问题的基准,每题配标准答案、支持依据与二元评分标准。实验评估 13 个前沿模型,最强模型 Claude Opus 4.8 完全正确率仅 42.9%,且更多轮次、工具调用与推理成本并不能预测更高准确率。同日另一篇 arXiv 论文提出面向科学 AI 的本体锚定推理评估基准,与本事件无关。
Generated from reports · updated 2 hr ago
Developments
2 developments
- Oct 2 · 1 reportsLegal Research Bench:衡量长程法律研究代理的端到端可靠性arXiv · Artificial Intelligence: Legal Research Bench:衡量长程法律研究智能体的端到端可靠性
- Oct 2 · 1 reportsOntology-Grounded Reasoner-Verified Benchmarks for LLM ScienarXiv · Artificial Intelligence: 面向科学 AI 中 LLM 推理评估的本体锚定、推理器验证基准
Timeline
Follow the coverage from different angles.
Oct 2, 2026
- arXiv · Artificial Intelligence面向科学 AI 中 LLM 推理评估的本体锚定、推理器验证基准
该研究提出从 OWL 2 本体自动生成多选题基准的流水线,正确答案由本体锚定,干扰项通过 OWL 推理器形式化验证。在 Pizza(112 题)、PMDco(2,491 题)和 DOID(15,216 题)三个本体上生成基准,6 个 LLM 零样本准确率为 41.1%-76.8%,显著高于 25% 随机基线。
- arXiv · Artificial Intelligence精选Legal Research Bench:衡量长程法律研究智能体的端到端可靠性
论文提出 Legal Research Bench,包含 413 道专家撰写的开放性美国法律研究问题,每题配有标准答案、支持依据和二元评分标准。实验评估了 13 个前沿模型,最强模型 Claude Opus 4.8 完全正确率仅 42.9%,且更多轮次、工具调用和推理成本并不能预测更高准确率。
Heat trend
There is not enough continuous observation data to draw a trend yet.