Hot eventLive
压缩语言模型中总变差比KL更能预测决策翻转
1 reports1 sources3 hr ago updated
Get the story
AI overview
压缩语言模型部署需要评估密集模型决策的变化量。研究证明总变差(total variation)比 KL 散度更直接:在 802 个压缩/扰动副本、19 个开源模型、5 个语料和 9 类扰动上,arg-max token 翻转率与总变差的中值比率为 1.05,无需拟合常数;KL 需经平方根和跨模型/语料四倍变化的因子才能换算为翻转。
Generated from reports · updated 3 hr ago
Timeline
Follow the coverage from different angles.
Oct 2, 2026
- arXiv · Statistics Machine Learning压缩语言模型中总变差如何直接决定决策翻转
压缩语言模型的部署需要知道密集模型的决策变化量,研究证明总变差(total variation)比 KL 散度更直接。在 802 个压缩/扰动副本、19 个开源模型、5 个语料和 9 类扰动上,arg-max token 翻转率与总变差的中值比率为 1.05,无需拟合常数;KL 需经平方根和跨模型/语料四倍变化的因子才能换算为翻转。
Heat trend
There is not enough continuous observation data to draw a trend yet.