arXiv · Software Engineering· Xingru Zhou, Luis Sentis, Aarti Choudhary·· 4 hr agoAI score30
SAFESHIELD:面向小型语言模型部署期安全的决策组织框架
SAFESHIELD: A Decision-Organization Framework for Deployment-Time Safety of Small Language Models
AI brief
SAFESHIELD 把小型语言模型的部署期安全建模为决策组织问题,将安全决策拆分为准入、路由、证据、发布四类职责,并以可审计的 Decision Traces 记录已提交决策。协调消融实验显示,切断准入门控会显著增加误发布;发布决策缺少上游证据时,发布准确率从 96.0% 降至 69.5%。结果表明部署期安全不仅取决于单个护栏能力,也取决于决策如何组织与协调。
Source: arXiv · Software Engineering · arxiv.org