评测来源官方评测
EQ-Bench 4 · 情绪与人际理解
EQ-Bench · 在多轮交流中理解人物情绪、隐含需求与不同的沟通偏好。
在 WebAi 中观察中
证据预算不计分
上游数据时间待核实
最近成功同步尚未开始采集
它测什么,怎么测
120 个模拟人物、16 轮角色扮演,三家模型裁判轮换盲评;只采用 Elo,行为风格 traits 不作越高越好的能力分。旧 v3 不重复计票。
如何使用这份证据
观察中:公开数据和许可可用,等待新一轮评测;不延长有效期来凑分类来源数。
评测局限与数据署名
英文模拟交流且尚未用人类专家验证,不能等同真人满意度或中文情商;当前成绩已超 45 天窗口。
数据许可:MIT · EQ-bench-site README 元数据声明
成绩由 EQ-Bench 发布,原始分数与 WebAi 共识分使用不同尺度,不能直接相加。