评测来源官方评测
Artificial Analysis Intelligence Index
Artificial Analysis · 把多项当前评测放到同一套环境里复跑,得到一个综合能力分。价格只作参考,不进总分。
在 HOTAI 中参与排名
证据预算30%
上游数据时间待核实
最近成功同步09/30 08:05
它测什么,怎么测
只取官方 Artificial Analysis Intelligence Index;接口中的性能与价格字段不计分。
如何使用这份证据
综合任务证据占 30%;已核对 v4.3 的 10 项底层评测,与现役专项没有重复计票。整项保留,不将聚合分冒充单项成绩。
评测成绩
按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 7 | gpt-6-astraOpenAI | 52.7 | Max 推理 |
| 10 | gpt-6-1-solOpenAI | 51.8 | Max 推理 |
| 15 | claude-opus-5Anthropic | 50.8 | Max 推理 · 自适应 |
| 21 | muse-spark-1-3Meta | 48.1 | Max 推理 |
| 24 | gpt-6-solOpenAI | 47.5 | Max 推理 |
| 25 | gpt-5-6-solOpenAI | 47 | Max 推理 |
| 28 | grok-4-7xAI | 46.4 | xHigh 推理 |
| 29 | mimo-v2-6-proXiaomi | 46.3 | 来源默认配置 |
| 32 | qwen3-8-maxAlibaba | 45.4 | 来源默认配置 |
| 34 | glm-5-3Z.ai | 44.8 | Max 推理 |
| 37 | grok-4-6-xhighxAI | 44.2 | xHigh 推理 |
| 40 | step-5StepFun | 43.7 | 来源默认配置 |
| 41 | kimi-k3Moonshot AI | 43.6 | Max 推理 |
| 46 | gpt-5-6-terraOpenAI | 42.1 | Max 推理 |
| 48 | glm-5-3-flashZ.ai | 41.8 | 来源默认配置 |
| 48 | claude-opus-4-8Anthropic | 41.8 | Max 推理 · 自适应 |
| 50 | gemini-3-8-flashGoogle | 40.9 | High 推理 |
| 51 | claude-opus-4-7Anthropic | 40.7 | Max 推理 · 自适应 |
| 54 | qwen3-8-2-4t-a95bAlibaba | 39.9 | 来源默认配置 |
| 55 | qwen3-8-flash-nextAlibaba | 39.8 | 来源默认配置 |
| 58 | muse-spark-1-2Meta | 39.6 | xHigh 推理 |
| 60 | deepseek-v4-1-flashDeepSeek | 39.5 | Max 推理 |
| 63 | gemini-3-7-flashGoogle | 39.1 | High 推理 |
| 64 | gpt-5-4OpenAI | 39 | xHigh 推理 |
| 65 | grok-4-5xAI | 38.8 | High 推理 |
| 66 | gpt-5-5OpenAI | 38.4 | xHigh 推理 |
| 67 | claude-sonnet-5Anthropic | 38.2 | Max 推理 · 自适应 |
| 69 | mimo-v2-6-flashXiaomi | 37.9 | 来源默认配置 |
| 70 | gpt-5-6-lunaOpenAI | 37.3 | Max 推理 |
| 70 | gpt-6-lunaOpenAI | 37.3 | Max 推理 |
评测局限与数据署名
缺少 API key 时整张来源退出本轮,不补 50 分;严禁用网页抓取替代,展示时必须署名并保留指数版本。
数据许可:API 数据展示或分享须显著署名;再分发权与定制条款须另行取得并遵守 Terms of Use
成绩由 Artificial Analysis 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。