arXiv · Software Engineering· Naing Oo Lwin·· 2 小时前精选AI 评分67
FORALL-LEAN-AGENT:形式数学与软件验证中的可审计推理
FORALL-LEAN-AGENT for Auditable Reasoning in Formal Mathematics and Software Verification
AI 导读
论文提出 FORALL-LEAN-AGENT,一个前端无关的框架,用于形式数学和软件验证中的可审计推理,结合隔离工作区、Lean 工具与独立证明检查。在 VeriSoftBench 100 任务子集上,GPT-5.6 Sol 集成后基准规则成功数从 93 提升到 100,成本从 $69 降至 $62;PutnamBench 评估以平均每个问题 $4.72 接受全部 672 个问题。
推荐理由
框架把验证证据与评审决定绑定到同一候选工件,使可接受性可追溯,为形式化证明的审计提供可迁移方法。
来源:arXiv · Software Engineering · arxiv.org