arXiv · Software Engineering· Aleksi Huotala, Miikka Kuutila, Mika M\"antyl\"a·· 3 小时前AI 评分35
LLM 在软件工程系统综述中的筛选性能是否停滞?
Has LLM Screening Performance Stalled in Software Engineering Systematic Reviews?
AI 导读
基于软件工程系统综述筛选基准 SESR-Eval 及低成本子集 SESR-Eval-Mini,研究评估了 8 款新 LLM 的筛选表现,并与 7 款旧模型对比:二次研究的平均 MCC 仅从 0.347 升至 0.365,模型间差异仍小于研究间差异。
来源:arXiv · Software Engineering · arxiv.org