Skip to content
Evaluation sources

Longform Writing

EQ-Bench · 长篇故事的连贯性与完整性

Official evaluation
On HOTAIRanked
Evidence budget2.4%
Upstream data09/24 15:57
Last successful sync10/01 20:05

What and how it measures

采用 overall_score_100;八章长文的情节与表达评分,裁判偏好作为局限披露。

How this evidence is used

正式计分;两张写作榜合计占 6%,不按题数或模型数增加权重。

Evaluation results

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

Source rankSource modelRaw scoreRepresentative configuration
1claude-opus-5Anthropic86.3来源默认配置
2claude-fable-5-1Anthropic85.3来源默认配置
3claude-opus-5-5Anthropic84.6来源默认配置
4grok-4.7xAI83来源默认配置
4claude-fable-5Anthropic83来源默认配置
6gpt-6-astraOpenAI82.8来源默认配置
6gpt-6-solOpenAI82.8来源默认配置
6muse-spark-1.3Meta82.8来源默认配置
9aion-3.5aion-labs82.1来源默认配置
10claude-opus-4-7Anthropic81.8来源默认配置
10GLM-5.3Z.ai81.8来源默认配置
12gpt-5.6-solOpenAI81.7来源默认配置
13muse-spark-1.2Meta81.5来源默认配置
14claude-opus-4-8Anthropic80.8来源默认配置
15claude-sonnet-4-6Anthropic79.9来源默认配置
15ox-alpha—79.9来源默认配置
17kimi-k3Moonshot AI79.6来源默认配置
18moonshotai/Kimi-K2.6Moonshot AI78.5来源默认配置
19gpt-5.4OpenAI78.3来源默认配置
19claude-sonnet-5Anthropic78.3来源默认配置
21gpt-5.5OpenAI78.2来源默认配置
22gpt-5.6-terraOpenAI78来源默认配置
23zai-org/GLM-5.2Z.ai77.9来源默认配置
24claude-opus-4-6Anthropic77.7来源默认配置
25gemini-3.8-flashGoogle76.8来源默认配置
26deepseek-ai/DeepSeek-V4-ProDeepSeek75.6来源默认配置
27gpt-5.6-lunaOpenAI75.5来源默认配置
28moonshotai/Kimi-K2.5Moonshot AI74.9来源默认配置
29Altworld/Hemmingway-1—74.2来源默认配置
30deepseek-v4.1-flashDeepSeek74来源默认配置
Evaluation limits and attribution

以英文写作为主,依赖模型裁判;同一裁判和相关任务共用预算,不代表中文文笔。

Data license: MIT · EQ-bench-site README 元数据声明

成绩由 EQ-Bench 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。