热点事件持续更新
LLM自评与行为差距研究覆盖25模型
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026年10月8日,arXiv Human-Computer Interaction 发布一手研究,构建由 LLM 专属行为组成的自陈量表,对17家开发者的25个LLM施测,每模型300题、各30次,得到五个可复现因子。研究将自陈结果与2500个开放式行为样本的人类评分对比,发现两者几乎不相关,verbose 除外;在 Responsiveness 上,自陈更贴近 LLM 评委而非人类。论文据此指出模型自我报告与实际行为存在差距。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
研究对25个LLM施测并发现自陈与人类行为评分几乎不相关,verbose除外。报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · Human-Computer InteractionLLM 原生心理测量工具揭示 25 个模型的自我报告与行为差距
论文构建由 LLM 专属行为组成的自陈量表,对 17 家开发者的 25 个 LLM 施测 300 题各 30 次,得到五个可复现因子。自陈结果与 2500 个开放式行为样本的人类评分几乎不相关,verbose 除外;Responsiveness 上自陈更贴近 LLM 评委而非人类。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。