arXiv · Software Engineering· Sandeep Dhuri·· 2 小时前精选AI 评分64
规范先行:LLM 生成代码在资金、时间、幂等与访问任务上的预注册五模型对比评估
Specification Before Generation: A Pre-Registered, Five-Model Paired Evaluation of a Specification Frame for LLM-Generated Code in Money, Time, Idempotency, and Access Tasks
AI 导读
论文预注册假设后,用 50 个真实后端任务对比五款前沿模型在无规范与带 267 字规范框架两种条件下的输出。规范框架使缺陷数均值下降 0.16–0.70/任务,所有 Holm 校正符号检验显著,Bootstrap 置信区间不包含零;框架臂在 100 次对比中赢 95 次,且未使任一模型在任何领域更差。
推荐理由
给团队一个可复现的实证:267 字规范框架在五款前沿模型上稳定降低缺陷,且不损害任何模型。
来源:arXiv · Software Engineering · arxiv.org