跳到正文
热点事件持续更新

LLM自评与行为差距研究覆盖25模型

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月8日,arXiv Human-Computer Interaction 发布一手研究,构建由 LLM 专属行为组成的自陈量表,对17家开发者的25个LLM施测,每模型300题、各30次,得到五个可复现因子。研究将自陈结果与2500个开放式行为样本的人类评分对比,发现两者几乎不相关,verbose 除外;在 Responsiveness 上,自陈更贴近 LLM 评委而非人类。论文据此指出模型自我报告与实际行为存在差距。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · Human-Computer Interaction
    LLM 原生心理测量工具揭示 25 个模型的自我报告与行为差距

    论文构建由 LLM 专属行为组成的自陈量表,对 17 家开发者的 25 个 LLM 施测 300 题各 30 次,得到五个可复现因子。自陈结果与 2500 个开放式行为样本的人类评分几乎不相关,verbose 除外;Responsiveness 上自陈更贴近 LLM 评委而非人类。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。