跳到正文
热点事件持续更新

压缩语言模型中总变差比KL更能预测决策翻转

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

压缩语言模型部署需要评估密集模型决策的变化量。研究证明总变差(total variation)比 KL 散度更直接:在 802 个压缩/扰动副本、19 个开源模型、5 个语料和 9 类扰动上,arg-max token 翻转率与总变差的中值比率为 1.05,无需拟合常数;KL 需经平方根和跨模型/语料四倍变化的因子才能换算为翻转。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv · Statistics Machine Learning
    压缩语言模型中总变差如何直接决定决策翻转

    压缩语言模型的部署需要知道密集模型的决策变化量,研究证明总变差(total variation)比 KL 散度更直接。在 802 个压缩/扰动副本、19 个开源模型、5 个语料和 9 类扰动上,arg-max token 翻转率与总变差的中值比率为 1.05,无需拟合常数;KL 需经平方根和跨模型/语料四倍变化的因子才能换算为翻转。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。