Skip to content
arXiv · Software Engineering· Naing Oo Lwin·· 3 hr agoSelectedAI score67

FORALL-LEAN-AGENT:形式数学与软件验证中的可审计推理

FORALL-LEAN-AGENT for Auditable Reasoning in Formal Mathematics and Software Verification

AI brief

论文提出 FORALL-LEAN-AGENT,一个前端无关的框架,用于形式数学和软件验证中的可审计推理,结合隔离工作区、Lean 工具与独立证明检查。在 VeriSoftBench 100 任务子集上,GPT-5.6 Sol 集成后基准规则成功数从 93 提升到 100,成本从 $69 降至 $62;PutnamBench 评估以平均每个问题 $4.72 接受全部 672 个问题。

Why it matters

框架把验证证据与评审决定绑定到同一候选工件,使可接受性可追溯,为形式化证明的审计提供可迁移方法。

Source: arXiv · Software Engineering · arxiv.org