跳到正文
热点事件持续更新

评论:AI拒绝能力被过度信任

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月9日,MIT Technology Review 发表评论,讨论人们对AI拒绝回答能力的信任是否过高。文章指出,现代AI的拒绝能力由训练、分类器和多层防护共同构成,但本质仍是概率性的,可能被越狱绕过,也可能出现过度拒绝。报道提到,Anthropic称某类分类器使聊天机器人计算成本增加24%;Fable 5发布后不到三天即被Amazon研究人员解锁部分黑客能力。文章还以OpenAI for Countries等本地化安排及多国模型审查差异为例,说明拒绝机制也可能被政府用于限制合法言论。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. MIT Technology Review · AI
    我们是否对 AI 拒绝回答的能力过于信任

    文章认为现代 AI 的拒绝能力由训练、分类器和多层防护共同构成,但本质仍是概率性的,会被越狱绕过,也可能过度拒绝。Anthropic 称某类分类器使聊天机器人计算成本增加 24%,Fable 5 发布后不到三天即被 Amazon 研究人员解锁部分黑客能力。OpenAI for Countries 等本地化安排与多国模型审查差异显示,拒绝机制也可能被政府用于限制合法言论。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。