01 GPT-6 Astra OpenAI Released 2026-09-03 · Low Cached input ¥6.7 Input ¥67.05 · Output ¥335.23 2026-09-03 20 evaluations Low confidenceRank range 1—6 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥6.7 ¥67.05 ¥335.23 97.0 02 Gemini 4 Argon Google Released 2026-09-30 · Low Cached input — Input — · Output — 2026-09-30 6 evaluations Low confidenceRank range 1—2 名 Rank after checking eligibility across 70 scenarios. 8 scenarios lack enough evidence. This is not a confidence interval. Pending Pending Pending 96.6 03 O GPT-6.1 Sol OpenAI Released 2026-09-29 · Low Cached input — Input — · Output — 2026-09-29 13 evaluations Low confidenceRank range 2—7 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. Pending Pending Pending 95.5 04 Claude Opus 5.5 Anthropic Released 2026-09-17 · Medium Cached input ¥1.34 Input ¥26.82 · Output ¥134.09 2026-09-17 15 evaluations Medium confidenceRank range 2—4 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥1.34 ¥26.82 ¥134.09 95.4 05 Claude Fable 5.1 Anthropic Released 2026-09-01 · Medium Cached input ¥1.68 Input ¥67.05 · Output ¥335.23 2026-09-01 17 evaluations Medium confidenceRank range 3—5 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥1.68 ¥67.05 ¥335.23 94.9 06 claude-sonnet-5-5 — Released — · Medium Cached input — Input — · Output — — 11 evaluations Medium confidenceRank range 4—6 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. Pending Pending Pending 94.3 07 Claude Fable 5 Anthropic Released 2026-06-09 · Low Cached input ¥6.7 Input ¥67.05 · Output ¥335.23 2026-06-09 19 evaluations Low confidenceRank range 5—8 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥6.7 ¥67.05 ¥335.23 94.0 08 Claude Opus 5 Anthropic Released 2026-07-24 · High Cached input ¥3.35 Input ¥33.52 · Output ¥167.61 2026-07-24 20 evaluations High confidenceRank range 6—8 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥3.35 ¥33.52 ¥167.61 93.9 09 Muse Spark 1.3 Meta Released 2026-09-02 · High Cached input — Input ¥8.38 · Output ¥28.49 2026-09-02 16 evaluations High confidenceRank range 8—9 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. — ¥8.38 ¥28.49 91.7 10 GPT-6 Sol OpenAI Released 2026-09-22 · Low Cached input ¥1.34 Input ¥13.41 · Output ¥67.05 2026-09-22 16 evaluations Low confidenceRank range 9—13 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥1.34 ¥13.41 ¥67.05 89.5 11 GPT-5.6 Sol OpenAI Released 2026-07-09 · High Cached input ¥2.68 Input ¥26.82 · Output ¥134.09 2026-07-09 20 evaluations High confidenceRank range 10—11 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥2.68 ¥26.82 ¥134.09 88.5 12 Grok 4.7 xAI Released 2026-09-21 · Low Cached input ¥3.35 Input ¥13.41 · Output ¥40.23 2026-09-21 11 evaluations Low confidenceRank range 11—31 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥3.35 ¥13.41 ¥40.23 86.3 13 X MiMo V 2.6 Pro Xiaomi Released 2026-09-21 · Low Cached input — Input — · Output — 2026-09-21 6 evaluations Low confidenceRank range 12—14 名 Rank after checking eligibility across 70 scenarios. 7 scenarios lack enough evidence. This is not a confidence interval. Pending Pending Pending 85.0 14 Qwen3.8 Max Alibaba Released 2026-07-19 · Low Cached input — Input ¥12 · Output ¥36 2026-07-19 18 evaluations Low confidenceRank range 12—15 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. — ¥12 ¥36 83.8 15 GLM-5.3 Z.ai Released 2026-08-18 · Low Cached input ¥1.74 Input ¥9.39 · Output ¥29.5 2026-08-18 19 evaluations Low confidenceRank range 13—20 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥1.74 ¥9.39 ¥29.5 80.6 16 Grok 4.6 xAI Released 2026-08-12 · Low Cached input ¥3.35 Input ¥13.41 · Output ¥40.23 2026-08-12 18 evaluations Low confidenceRank range 14—26 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥3.35 ¥13.41 ¥40.23 78.8 17 Kimi K3 Moonshot AI Released 2026-07-16 · Low Cached input ¥2 Input ¥20 · Output ¥100 2026-07-16 19 evaluations Low confidenceRank range 14—18 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥2 ¥20 ¥100 78.0 18 GPT-5.6 Terra OpenAI Released 2026-07-09 · Low Cached input ¥1.34 Input ¥13.41 · Output ¥80.45 2026-07-09 20 evaluations Low confidenceRank range 16—29 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥1.34 ¥13.41 ¥80.45 75.6 19 Claude Opus 4.8 Anthropic Released 2026-05-28 · Low Cached input ¥3.35 Input ¥33.52 · Output ¥167.61 2026-05-28 20 evaluations Low confidenceRank range 17—21 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥3.35 ¥33.52 ¥167.61 74.0 20 Gemini 3.8 Flash Google Released 2026-09-02 · Low Cached input ¥0.5 Input ¥5.03 · Output ¥25.14 2026-09-02 20 evaluations Low confidenceRank range 10—21 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥0.5 ¥5.03 ¥25.14 73.5 21 Qwen3.8 Max 0902 Alibaba Released 2026-09-01 · Low Cached input — Input ¥12 · Output ¥36 2026-09-01 7 evaluations Low confidenceRank range 12—22 名 Rank after checking eligibility across 70 scenarios. 5 scenarios lack enough evidence. This is not a confidence interval. — ¥12 ¥36 73.3 22 GLM-5.3 Flash Z.ai Released 2026-08-26 · Low Cached input ¥0.23 Input ¥0.8 · Output ¥2.8 2026-08-26 17 evaluations Low confidenceRank range 18—37 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥0.23 ¥0.8 ¥2.8 72.7 23 Claude Opus 4.7 Anthropic Released 2026-04-16 · Low Cached input ¥3.35 Input ¥33.52 · Output ¥167.61 2026-04-16 18 evaluations Low confidenceRank range 16—24 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥3.35 ¥33.52 ¥167.61 71.8 24 Qwen3.8 Flash Next Alibaba Released 2026-08-26 · Low Cached input — Input ¥0.8 · Output ¥2.7 2026-08-26 5 evaluations Low confidenceRank range 22—25 名 Rank after checking eligibility across 70 scenarios. 7 scenarios lack enough evidence. This is not a confidence interval. — ¥0.8 ¥2.7 70.2 25 Muse Spark 1.2 Meta Released 2026-08-05 · Low Cached input — Input ¥8.38 · Output ¥28.49 2026-08-05 14 evaluations Low confidenceRank range 17—26 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. — ¥8.38 ¥28.49 68.8 26 DeepSeek V4.1 Flash DeepSeek Released 2026-09-10 · Low Cached input ¥0.0402 Input ¥2.01 · Output ¥8.05 2026-09-10 12 evaluations Low confidenceRank range 22—28 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥0.0402 ¥2.01 ¥8.05 65.9 27 Gemini 3.7 Flash Google Released 2026-08-13 · Low Cached input ¥0.5 Input ¥5.03 · Output ¥25.14 2026-08-13 18 evaluations Low confidenceRank range 9—27 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥0.5 ¥5.03 ¥25.14 65.5 28 GPT-5.4 OpenAI Released 2026-03-05 · Low Cached input ¥1.68 Input ¥16.76 · Output ¥100.57 2026-03-05 12 evaluations Low confidenceRank range 24—29 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥1.68 ¥16.76 ¥100.57 62.1 29 Grok 4.5 xAI Released 2026-07-08 · Low Cached input ¥2.01 Input ¥13.41 · Output ¥40.23 2026-07-08 18 evaluations Low confidenceRank range 25—32 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥2.01 ¥13.41 ¥40.23 60.0 30 GPT-5.5 OpenAI Released 2026-04-23 · Low Cached input ¥3.35 Input ¥33.52 · Output ¥201.14 2026-04-23 19 evaluations Low confidenceRank range 12—30 名 Rank after checking eligibility across 70 scenarios. This is not a confidence interval. ¥3.35 ¥33.52 ¥201.14 59.8