arXiv · Computation and Language· Haohan Yuan, Simin Chen, Xi Niu, Hanqing Guo, Depeng Xu, Haopeng Zhang·· 3 小时前AI 评分52
ForgePrint:通过针对性改写伪造大语言模型作者指纹
Forging LLM Authorship Fingerprints with Targeted Rewriting
AI 导读
论文提出 ForgePrint 搜索再蒸馏框架,将某模型输出改写为使归因分类器指向目标模型。在 CNN/DM 上,4B 学生模型目标成功率 70.2%,超过教师模型 54.1% 及六种基线最强 39.3%;在开放模型向商业模型迁移时达 68.3%。结果表明未修改文本上的准确归因不能保证改写后仍能识别真实来源。
来源:arXiv · Computation and Language · arxiv.org