Evaluation sourcesOfficial evaluation
TubeLab · 视频脚本
TubeLab · 面向不同视频频道写脚本,比较故事组织、文风、节奏与清晰度。
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started
What and how it measures
统一 TubeLab Scriptwriter、12 个任务、6 项写作质量;三家模型裁判不评自己家,失败任务保留惩罚。成本和速度不进入能力。
How this evidence is used
观察中:等待稳定原始数据、准确评测日期和复用边界,不用展示页面代替可核验成绩。
Evaluation limits and attribution
模型受 Scriptwriter 流程影响;OpenAI 使用最低推理档位,不能外推到其它档位。视频口播不等于电影剧本。
Data license: 未确认稳定成绩导出和公开聚合许可。
成绩由 TubeLab 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。