Skip to content
Evaluation sources

Short-Story · 短篇小说

Lech Mazur · 把固定人物、情节与风格要求自然写进一篇完整短篇小说。

Official evaluation
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started

What and how it measures

600–800 词短篇、10 项创作要求;同提示、三家裁判、双向比较。采用 Thurstone 主分,BT 仅作诊断,不重复计票;多档位按固定规则选取。

How this evidence is used

观察中:补齐正式数据复用边界并解决 README 与机器成绩不同步后再接入。

Evaluation limits and attribution

模型裁判仍有文学偏好;部分型号未完成全部故事。短篇能力不等于长篇小说或中文文笔。

Data license: 未找到明确的榜单数据复用许可;GitHub 公开不等于开放授权。

成绩由 Lech Mazur 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。