跳到正文
原文
arXiv · Computers and Society· Xuancun Lu, Zhengxian Huang, Xinfeng Li, Chi Zhang, Xiaoyu Ji, Wenyuan Xu·· 2 小时前精选AI 评分62

Easier Said Than Done:拆解针对 LLM 机器人的越狱意图与行为鸿沟

Easier Said Than Done: Unpacking Intent-Behavior Gap in Jailbreaking LLM-Based Robots

AI 导读

该研究指出针对 LLM 机器人的现有越狱攻击多在策略层面成功,却因机器人语法约束与物理可行性限制而难以转化为实际有害动作。论文提出 POEF 框架,利用未对齐 LLM 的隐藏层梯度优化越狱提示,并通过多智能体评估策略可行性,在 Unitree G1、Franka 机械臂及仿真实验中达到 80% 行为越狱成功率,并提出两种防御策略。

推荐理由

论文揭示了针对 LLM 机器人的意图与行为脱节漏洞,并给出自动化红队框架与防御方向。

来源:arXiv · Computers and Society · arxiv.org