Evaluation sourcesOfficial evaluation
ToneBench · 文风与脚本
Towards AI · 按指定作者文风写视频脚本,考查开场、结构、表达与口播节奏。
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started
What and how it measures
10 个真实脚本任务、多次生成、三家裁判;只比较相同任务、rubric、裁判和运行指纹。混合模型回退行须排除,不按每列最高成绩选配置。
How this evidence is used
观察中:数据协议和当期覆盖较好,待确认成绩再展示边界并核验纯模型配置。
Evaluation limits and attribution
偏向 Towards AI 的单一频道文风,精确题目和参考脚本未公开;现有第一名含 Fable 5 + Opus 4.8 回退,不能作为单型号成绩。
Data license: 公开 JSON 可读取,尚未找到明确的数据聚合与再展示条款。
成绩由 Towards AI 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。