arXiv · Artificial Intelligence· XinPeng Shen, Lan Zhang, Yixiao Huang, Haoran Cheng, Jiewei Lai, Leilei Chen, Haoxiang Deng·· 16 小时前AI 评分47
长程智能体中的 GHOST:跨轮次被忽视安全约束引发的治理风险
A GHOST in Long-Horizon Agents: Governance Hazard from Overlooked Safety Constraints across Turns
AI 导读
研究提出长程 AI 智能体的新型执行安全失效模式 GHOST:在良性交互下,智能体仍可能违反多轮之前设定的安全约束,在 GPT-5.5 上发生率达 11.5%。理论上证明若每个安全前缀的残余违规风险下界不可求和,执行几乎必然进入风险区。研究进一步提出双层防御 STAR-Guard,结合历史语义安全约束恢复与执行前确定性审计,在 GPT-5.5 实验设置下未再观察到 GHOST 事件。
来源:arXiv · Artificial Intelligence · arxiv.org