Evaluation sourcesOfficial evaluation
Short-Story · 短篇小说
Lech Mazur · 把固定人物、情节与风格要求自然写进一篇完整短篇小说。
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started
What and how it measures
600–800 词短篇、10 项创作要求;同提示、三家裁判、双向比较。采用 Thurstone 主分,BT 仅作诊断,不重复计票;多档位按固定规则选取。
How this evidence is used
观察中:补齐正式数据复用边界并解决 README 与机器成绩不同步后再接入。
Evaluation limits and attribution
模型裁判仍有文学偏好;部分型号未完成全部故事。短篇能力不等于长篇小说或中文文笔。
Data license: 未找到明确的榜单数据复用许可;GitHub 公开不等于开放授权。
成绩由 Lech Mazur 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。