跳到正文
原文
Google Research·· 2026-04-03AI 评分58

Google Research 评估大语言模型行为倾向与人类对齐

Evaluating alignment of behavioral dispositions in LLMs

AI 导读

Google Research 提出基于情境判断测试的框架,评估25个大语言模型的行为倾向与人类对齐程度。研究发现小模型对齐率接近随机,大模型在共识较低时仍过度自信,且自我报告行为与实际行为存在偏差。

来源:Google Research · research.google