跳到正文
热点事件持续更新

LeanSide 与 FORALL-LEAN-AGENT:自然语言形式化证明协同推理与可审计推理框架

2 篇报道2 个报道来源2 小时前 更新

先了解这件事

AI 综述

LeanSide 是一个形式化协同推理系统,允许用户以自由自然语言编写和修订证明,后端自动将其形式化为 Lean 并返回可理解的验证反馈;研究通过本科数学课堂部署的用户实验,分析了系统哪些特性帮助学生推进、哪些导致卡壳,并据此得出形式化后端在人机协同推理中的设计启示。同日另一篇一手报道提出 FORALL-LEAN-AGENT,一个前端无关的框架,用于形式数学和软件验证中的可审计推理,结合隔离工作区、Lean 工具与独立证明检查;在 VeriSoftBench 100 任务子集上,GPT-5.6 Sol 集成后基准规则成功数从 93 提升到 100,成本从 $69 降至 $62;PutnamBench 评估以平均每个问题 $4.72 接受全部 672 个问题。

AI 根据报道生成 · 1 小时前更新

事件进展

2 个进展
  1. 10月2日 12:00 · 1 篇报道
    LeanSide:自然语言证明的正式验证协同推理系统
    arXiv · Human-Computer Interaction:LeanSide:自然语言证明的形式化协同推理系统
  2. 10月2日 12:00 · 1 篇报道
    FORALL-LEAN-AGENT:可审计推理的形式化数学与软件验证框架
    arXiv · Software Engineering:FORALL-LEAN-AGENT:形式数学与软件验证中的可审计推理

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv · Software Engineering精选
    FORALL-LEAN-AGENT:形式数学与软件验证中的可审计推理

    论文提出 FORALL-LEAN-AGENT,一个前端无关的框架,用于形式数学和软件验证中的可审计推理,结合隔离工作区、Lean 工具与独立证明检查。在 VeriSoftBench 100 任务子集上,GPT-5.6 Sol 集成后基准规则成功数从 93 提升到 100,成本从 $69 降至 $62;PutnamBench 评估以平均每个问题 $4.72 接受全部 672 个问题。

  2. arXiv · Human-Computer Interaction
    LeanSide:自然语言证明的形式化协同推理系统

    LeanSide 是一个形式化协同推理系统,允许用户以自由自然语言编写和修订证明,后端自动将其形式化为 Lean 并返回可理解的验证反馈。研究通过本科数学课堂部署的用户实验,分析了系统哪些特性帮助学生推进、哪些导致卡壳,并据此得出形式化后端在人机协同推理中的设计启示。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。