Skip to content
Evaluation sources

ToneBench · 文风与脚本

Towards AI · 按指定作者文风写视频脚本,考查开场、结构、表达与口播节奏。

Official evaluation
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started

What and how it measures

10 个真实脚本任务、多次生成、三家裁判;只比较相同任务、rubric、裁判和运行指纹。混合模型回退行须排除,不按每列最高成绩选配置。

How this evidence is used

观察中:数据协议和当期覆盖较好,待确认成绩再展示边界并核验纯模型配置。

Evaluation limits and attribution

偏向 Towards AI 的单一频道文风,精确题目和参考脚本未公开;现有第一名含 Fable 5 + Opus 4.8 回退,不能作为单型号成绩。

Data license: 公开 JSON 可读取,尚未找到明确的数据聚合与再展示条款。

成绩由 Towards AI 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。