热点事件持续更新
LeanSide 与 FORALL-LEAN-AGENT:自然语言形式化证明协同推理与可审计推理框架
2 篇报道2 个报道来源2 小时前 更新
先了解这件事
AI 综述
LeanSide 是一个形式化协同推理系统,允许用户以自由自然语言编写和修订证明,后端自动将其形式化为 Lean 并返回可理解的验证反馈;研究通过本科数学课堂部署的用户实验,分析了系统哪些特性帮助学生推进、哪些导致卡壳,并据此得出形式化后端在人机协同推理中的设计启示。同日另一篇一手报道提出 FORALL-LEAN-AGENT,一个前端无关的框架,用于形式数学和软件验证中的可审计推理,结合隔离工作区、Lean 工具与独立证明检查;在 VeriSoftBench 100 任务子集上,GPT-5.6 Sol 集成后基准规则成功数从 93 提升到 100,成本从 $69 降至 $62;PutnamBench 评估以平均每个问题 $4.72 接受全部 672 个问题。
AI 根据报道生成 · 1 小时前更新
事件进展
2 个进展
- 10月2日 12:00 · 1 篇报道LeanSide:自然语言证明的正式验证协同推理系统arXiv · Human-Computer Interaction:LeanSide:自然语言证明的形式化协同推理系统
- 10月2日 12:00 · 1 篇报道FORALL-LEAN-AGENT:可审计推理的形式化数学与软件验证框架arXiv · Software Engineering:FORALL-LEAN-AGENT:形式数学与软件验证中的可审计推理
报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv · Software Engineering精选FORALL-LEAN-AGENT:形式数学与软件验证中的可审计推理
论文提出 FORALL-LEAN-AGENT,一个前端无关的框架,用于形式数学和软件验证中的可审计推理,结合隔离工作区、Lean 工具与独立证明检查。在 VeriSoftBench 100 任务子集上,GPT-5.6 Sol 集成后基准规则成功数从 93 提升到 100,成本从 $69 降至 $62;PutnamBench 评估以平均每个问题 $4.72 接受全部 672 个问题。
- arXiv · Human-Computer InteractionLeanSide:自然语言证明的形式化协同推理系统
LeanSide 是一个形式化协同推理系统,允许用户以自由自然语言编写和修订证明,后端自动将其形式化为 Lean 并返回可理解的验证反馈。研究通过本科数学课堂部署的用户实验,分析了系统哪些特性帮助学生推进、哪些导致卡壳,并据此得出形式化后端在人机协同推理中的设计启示。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。