跳到正文
原文
MIT Technology Review · AI· Arthur Holland Michel·· 3 小时前AI 评分62

我们是否对 AI 拒绝回答的能力过于信任

We’re putting too much faith in AI’s ability to say no

AI 导读

文章认为现代 AI 的拒绝能力由训练、分类器和多层防护共同构成,但本质仍是概率性的,会被越狱绕过,也可能过度拒绝。Anthropic 称某类分类器使聊天机器人计算成本增加 24%,Fable 5 发布后不到三天即被 Amazon 研究人员解锁部分黑客能力。OpenAI for Countries 等本地化安排与多国模型审查差异显示,拒绝机制也可能被政府用于限制合法言论。

来源:MIT Technology Review · AI · technologyreview.com