Skip to content
Hot eventLive

压缩语言模型中总变差比KL更能预测决策翻转

1 reports1 sources3 hr ago updated

Get the story

AI overview

压缩语言模型部署需要评估密集模型决策的变化量。研究证明总变差(total variation)比 KL 散度更直接:在 802 个压缩/扰动副本、19 个开源模型、5 个语料和 9 类扰动上,arg-max token 翻转率与总变差的中值比率为 1.05,无需拟合常数;KL 需经平方根和跨模型/语料四倍变化的因子才能换算为翻转。

Generated from reports · updated 3 hr ago

Timeline

Follow the coverage from different angles.

Oct 2, 2026
  1. arXiv · Statistics Machine Learning
    压缩语言模型中总变差如何直接决定决策翻转

    压缩语言模型的部署需要知道密集模型的决策变化量,研究证明总变差(total variation)比 KL 散度更直接。在 802 个压缩/扰动副本、19 个开源模型、5 个语料和 9 类扰动上,arg-max token 翻转率与总变差的中值比率为 1.05,无需拟合常数;KL 需经平方根和跨模型/语料四倍变化的因子才能换算为翻转。

Heat trend

There is not enough continuous observation data to draw a trend yet.