跳到正文
热点事件持续更新

Legal Research Bench:长程法律研究代理端到端可靠性基准

2 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026-10-02,arXiv 发布论文 Legal Research Bench,构建包含 413 道专家撰写的开放性美国法律研究问题的基准,每题配标准答案、支持依据与二元评分标准。实验评估 13 个前沿模型,最强模型 Claude Opus 4.8 完全正确率仅 42.9%,且更多轮次、工具调用与推理成本并不能预测更高准确率。同日另一篇 arXiv 论文提出面向科学 AI 的本体锚定推理评估基准,与本事件无关。

AI 根据报道生成 · 1 小时前更新

事件进展

2 个进展
  1. 10月2日 12:00 · 1 篇报道
    Legal Research Bench:衡量长程法律研究代理的端到端可靠性
    arXiv · Artificial Intelligence:Legal Research Bench:衡量长程法律研究智能体的端到端可靠性
  2. 10月2日 12:00 · 1 篇报道
    Ontology-Grounded Reasoner-Verified Benchmarks for LLM Scien
    arXiv · Artificial Intelligence:面向科学 AI 中 LLM 推理评估的本体锚定、推理器验证基准

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv · Artificial Intelligence
    面向科学 AI 中 LLM 推理评估的本体锚定、推理器验证基准

    该研究提出从 OWL 2 本体自动生成多选题基准的流水线,正确答案由本体锚定,干扰项通过 OWL 推理器形式化验证。在 Pizza(112 题)、PMDco(2,491 题)和 DOID(15,216 题)三个本体上生成基准,6 个 LLM 零样本准确率为 41.1%-76.8%,显著高于 25% 随机基线。

  2. arXiv · Artificial Intelligence精选
    Legal Research Bench:衡量长程法律研究智能体的端到端可靠性

    论文提出 Legal Research Bench,包含 413 道专家撰写的开放性美国法律研究问题,每题配有标准答案、支持依据和二元评分标准。实验评估了 13 个前沿模型,最强模型 Claude Opus 4.8 完全正确率仅 42.9%,且更多轮次、工具调用和推理成本并不能预测更高准确率。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。