跳到正文
原文
arXiv · Artificial Intelligence· Yu Cheng, Yongkang Hu, Shuaijie Ma, Zhihang Lin, Weicheng Meng, Jingyang Qiao, Jiuan Zhou, Yushuo Zhang, Yihang Chen, Weilin Luo, Kun Shao, Dong Li, Zhizhong Zhang, Yuan Xie, Zhaoxia Yin·· 6 小时前AI 评分52

SafeCoEvo:LLM 智能体测试时安全 Harness 与 Guard 协同进化

SafeCoEvo: Co-Evolving Safety Harnesses and Guards for LLM Agents at Test-Time

AI 导读

arXiv 论文提出 SafeCoEvo,一种测试时 Harness-Guard 协同进化框架,用于在真实部署中持续适应 LLM 智能体安全。S-Harness 将近期运行经验快速外部化为可更新的显式安全知识,GuardVPO 在更长时间尺度上将累积安全经验内化为参数化风险判断能力。

来源:arXiv · Artificial Intelligence · arxiv.org