Skip to content
Evaluation sources

EQ-Bench 4 · 情绪与人际理解

EQ-Bench · 在多轮交流中理解人物情绪、隐含需求与不同的沟通偏好。

Official evaluation
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started

What and how it measures

120 个模拟人物、16 轮角色扮演,三家模型裁判轮换盲评;只采用 Elo,行为风格 traits 不作越高越好的能力分。旧 v3 不重复计票。

How this evidence is used

观察中:公开数据和许可可用,等待新一轮评测;不延长有效期来凑分类来源数。

Evaluation limits and attribution

英文模拟交流且尚未用人类专家验证,不能等同真人满意度或中文情商;当前成绩已超 45 天窗口。

Data license: MIT · EQ-bench-site README 元数据声明

成绩由 EQ-Bench 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。