arXiv · Artificial Intelligence· Ramin Pishehvar, Andrea Morandi, Mahesh Viswanathan·· 3 小时前AI 评分46
LLM 路由中升级信号的评测:目标、对照与五种自我欺骗方式
Evaluating Escalation Signals for LLM Routing: Targets, Controls, and Five Ways to Fool Yourself
AI 导读
论文测试语义熵作为小模型升级到大模型的预判信号,在 GSM8K 上以约 12 倍规模差的小/大模型对取得 AUROC 0.871,并在同等成本下把路由准确率较随机升级提升最多 9 个百分点。合成基准上的亮眼结果被证明误导:仅用题目难度的无模型规则几乎复现语义熵表现。论文给出评测升级信号的通用检查清单,并提前预测复用缓存结果的方案在新数据集上 AUROC 从 0.908 跌至随机水平 0.518。
来源:arXiv · Artificial Intelligence · arxiv.org