跳到正文
原文
arXiv · Computers and Society· Tapan Parikh·· 3 小时前AI 评分48

单词普查:44 个语言模型的答案选择一致性

The One-Word Census: Answer-Choice Conformity Across 44 Language Models

AI 导读

105 个语言模型在“选一个词”任务中 46% 选择 serendipity,96 个类别中 28 个出现单一答案占 80% 以上。重度后训练的主流实验室助手最顺从,轻度后训练和人格微调模型最分歧;GPT、Gemini、Grok 和 Qwen 跨版本更顺从,Claude 第 5 代则反转。SFT 是向群体答案靠拢的最大步骤,模型整体在 20 个共享类别中的 18 个比人类更集中。

来源:arXiv · Computers and Society · arxiv.org