2 evaluationsLow confidenceRank range1—2 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range1—8 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range9—13 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range10—12 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range18—20 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range18—24 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range19—22 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range16—23 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range14—29 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range21—26 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range22—34 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range23—30 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range24—28 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range25—29 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
2 evaluationsLow confidenceRank range26—30 名Rank after checking eligibility across 13 scenarios. 4 scenarios lack enough evidence. This is not a confidence interval.
¥2.01
¥20.11
¥100.57
20.3
Up to 30 models are shown per board
The consensus index is not accuracy; ties follow the ranking supported by shared evidence.
How to read this board
综合多家公开评测,不同模型的参评覆盖不同。 Prices do not affect ranking; missing scores are not treated as zero, and the index is not accuracy.
API prices come from vendor websites and are shown per million tokens. USD quotes are converted using the 2026-09-30 exchange rate. Cached price is the input price after a cache hit; cache writes, storage and subscription fees are separate.