Skip to content
arXiv · Software Engineering· Aleksi Huotala, Miikka Kuutila, Mika M\"antyl\"a·· 4 hr agoAI score35

LLM 在软件工程系统综述中的筛选性能是否停滞?

Has LLM Screening Performance Stalled in Software Engineering Systematic Reviews?

AI brief

基于软件工程系统综述筛选基准 SESR-Eval 及低成本子集 SESR-Eval-Mini,研究评估了 8 款新 LLM 的筛选表现,并与 7 款旧模型对比:二次研究的平均 MCC 仅从 0.347 升至 0.365,模型间差异仍小于研究间差异。

Source: arXiv · Software Engineering · arxiv.org