Google Research·· 2026-04-03AI 评分58
Google Research 评估大语言模型行为倾向与人类对齐
Evaluating alignment of behavioral dispositions in LLMs
AI 导读
Google Research 提出基于情境判断测试的框架,评估25个大语言模型的行为倾向与人类对齐程度。研究发现小模型对齐率接近随机,大模型在共识较低时仍过度自信,且自我报告行为与实际行为存在偏差。
来源:Google Research · research.google