跳到正文
原文
ScienceDaily · AI·· 2026-06-10AI 评分48

Stroop 任务暴露 AI 注意力短板:GPT-4o、Claude 3.5 Sonnet 等模型在长列表下准确率骤降

A classic brain test exposed AI's biggest weakness

AI 导读

GPT-4o 在 5 个词时准确率 91%,10 个词降至 57%,40 个词仅 15%;Claude 3.5 Sonnet 在 20 词内稳定,40 词时跌至 24%。GPT-5、Claude Opus 4.1、Gemini 2.5 也出现类似下降。AI 在颜色词冲突列表中难以抑制自动阅读倾向,准确率几近归零,而人类能保持稳定表现。

来源:ScienceDaily · AI · sciencedaily.com