Skip to content
arXiv · Software Engineering· Yunbei Zhang, Janet Wang, Saiyue Lyu, Yingqiang Ge, Kaiqu Liang, Zijian Jin, Chandan K Reddy, Jihun Hamm·· 3 hr agoSelectedAI score62

Safety Must Survive Self-Improvement: Why Failures Persist and How Agents Recover

Safety Must Survive Self-Improvement: Why Failures Persist and How Agents Recover

AI brief

论文研究递归自我改进(RSI)中的安全性延续问题,通过有状态授权任务的受控测试台,分析固定 LLM 编辑器对可执行智能体组件的优化与独立轨迹记录。在 48 条框架历史中,新授权依赖使历史分数在 22 条中保留不安全程序,尽管每个受影响归档都有正确替代方案;刷新分数可恢复原始套件正确性,但独立组合测试仍有残留失效。

Why it matters

研究通过受控测试台揭示递归自我改进中安全失效的持久性机制,并为编辑选择与验证策略提供可迁移的恢复方法。

Source: arXiv · Software Engineering · arxiv.org