arXiv · Artificial Intelligence· Jisheng Dang, Yushuo Zhao, Dewei Liu, Junfeng Fang, Bimei Wang, Tiantian Rao, Hong Peng, Bin Hu, Tat-Seng Chua·· 16 小时前AI 评分32
DNAlign:面向 LLM 的动态零空间安全对齐方法
DNAlign: Dynamic Null-Space Safe Alignment for LLMs
AI 导读
研究者提出 DNAlign,一种将控制论优化与零空间投影结合的轻量级 LLM 安全对齐框架。它把 LLM 视为动态系统并引入可控扰动引导生成安全行为,投影模块将扰动限制在由中性隐藏状态导出的有害相关子空间,以保留通用知识与响应质量。在多个 LLM 骨干上的评估显示,该框架在保持流畅性、连贯性、事实效用和生成多样性的同时降低有害输出,优于既有对齐基线,代码已开源。
来源:arXiv · Artificial Intelligence · arxiv.org