Evaluation sourcesOfficial evaluation
FACTS Parametric
Google DeepMind / Kaggle / 知识 · 不借助搜索工具回答世界事实问题,检验模型自身知识的准确性。
On HOTAIObserving
Evidence budgetUnweighted
Upstream dataTo verify
Last successful syncCollection not started
What and how it measures
只考虑固定任务版本的 Score,保留公开集、私有集与置信区间供核查;不能把三个相关分数重复计票。FACTS 不在 AA v4.3 的十项底层评测中。
How this evidence is used
观察中:官方协议与许可已确认,但没有完成题数或完整性标记;部分行区间显著宽,总分与公开集、私有集的汇总口径也存在待确认情形。等待评测方说明,不删除异常行来强行接入,不占评分预算。
Evaluation limits and attribution
裁判与评测发起方均来自 Google,需结合其他机构证据。导出未说明部分结果是否完成同一套题,不能把局部结果当完整评测;从区间反推的样本量不是官方确认事实。
Data license: Apache 2.0 · 官方 benchmark 与 Score task 页面明确声明;Kaggle 文档提供公共榜单的免登录 JSON 下载。
成绩由 Google DeepMind / Kaggle 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。