Skip to content
arXiv · Software Engineering· Shuyang Zhang·· 5 hr agoSelectedAI score62

LLM 智能体工具与技能评测的可估计量与有效性批判综述

What Does a Skill Actually Do? Estimands and Evaluation Validity for Tool and Skill Use in LLM Agents: A Critical Review

AI brief

该综述检查了 100 篇引用论文,并从 35 项研究中提取评测设计,分析工具与可复用技能在 LLM 智能体中的评估有效性。研究指出,同一任务上的配对运行不能识别调用效应,配对增益和回归计数仅反映耦合协议下的不一致性,而非期望结果恶化的任务占比;部署模块的总效应与预算约束下的效率回答不同问题。综述提供方法学综合与报告清单,以对齐工具与技能相关声明与其评测设计所支持的对比。

Why it matters

帮助读者辨别工具与技能评测中对比对象的差异,避免把方法学混杂误读为能力提升。

Source: arXiv · Software Engineering · arxiv.org