跳到正文
原文
arXiv · Machine Learning Theory· Domenic Rosati, Alessa Carbo, Ali Dadsetan, Hong Huang, Matthew Young, Subhabrata Majumdar, Frank Rudzicz, Hassan Sajjad·· 3 小时前AI 评分37

移除信息含量无法为开放权重模型证明防篡改能力

Removing Information Content Does Not Certify Tamper Resistance in Open-Weight Models

AI 导读

论文证明仅凭发布时的互信息无法普遍保证开放权重模型在微调攻击后恢复缓慢。保功能重参数化可在信息不变的情况下改变梯度下降几何,使不变量证书受限于最快可达参数化;存在一个显式构造使两类互信息均为零却一步恢复。研究指出认证还需对发布时互信息之外的攻击动态施加约束。

来源:arXiv · Machine Learning Theory · arxiv.org