ScienceDaily · AI·· 2026-06-10AI 评分48
Stroop 任务暴露 AI 注意力短板:GPT-4o、Claude 3.5 Sonnet 等模型在长列表下准确率骤降
A classic brain test exposed AI's biggest weakness
AI 导读
GPT-4o 在 5 个词时准确率 91%,10 个词降至 57%,40 个词仅 15%;Claude 3.5 Sonnet 在 20 词内稳定,40 词时跌至 24%。GPT-5、Claude Opus 4.1、Gemini 2.5 也出现类似下降。AI 在颜色词冲突列表中难以抑制自动阅读倾向,准确率几近归零,而人类能保持稳定表现。
来源:ScienceDaily · AI · sciencedaily.com