Hot eventLive
评论:AI拒绝能力被过度信任
1 reports1 sources3 hr ago updated
Get the story
AI overview
2026年10月9日,MIT Technology Review 发表评论,讨论人们对AI拒绝回答能力的信任是否过高。文章指出,现代AI的拒绝能力由训练、分类器和多层防护共同构成,但本质仍是概率性的,可能被越狱绕过,也可能出现过度拒绝。报道提到,Anthropic称某类分类器使聊天机器人计算成本增加24%;Fable 5发布后不到三天即被Amazon研究人员解锁部分黑客能力。文章还以OpenAI for Countries等本地化安排及多国模型审查差异为例,说明拒绝机制也可能被政府用于限制合法言论。
Generated from reports · updated 2 hr ago
Timeline
Follow the coverage from different angles.
Oct 9, 2026
- MIT Technology Review · AI我们是否对 AI 拒绝回答的能力过于信任
文章认为现代 AI 的拒绝能力由训练、分类器和多层防护共同构成,但本质仍是概率性的,会被越狱绕过,也可能过度拒绝。Anthropic 称某类分类器使聊天机器人计算成本增加 24%,Fable 5 发布后不到三天即被 Amazon 研究人员解锁部分黑客能力。OpenAI for Countries 等本地化安排与多国模型审查差异显示,拒绝机制也可能被政府用于限制合法言论。
Heat trend
There is not enough continuous observation data to draw a trend yet.