Evaluation sourcesOfficial evaluation
EQ-Bench 4 · 情绪与人际理解
EQ-Bench · 在多轮交流中理解人物情绪、隐含需求与不同的沟通偏好。
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started
What and how it measures
120 个模拟人物、16 轮角色扮演,三家模型裁判轮换盲评;只采用 Elo,行为风格 traits 不作越高越好的能力分。旧 v3 不重复计票。
How this evidence is used
观察中:公开数据和许可可用,等待新一轮评测;不延长有效期来凑分类来源数。
Evaluation limits and attribution
英文模拟交流且尚未用人类专家验证,不能等同真人满意度或中文情商;当前成绩已超 45 天窗口。
Data license: MIT · EQ-bench-site README 元数据声明
成绩由 EQ-Bench 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。