Back to leaderboard
Evaluation sources
What each source measures, how it updates and whether it affects ranking.
20Ranked this round69Reviewed sources and tracks
How ranking works 综合评测与体验
17跨能力的综合测试与真人盲选。
- RankedAA Index把多项当前评测放到同一套环境里复跑,得到一个综合能力分。价格只作参考,不进总分。Artificial AnalysisEvidence budget 30%
- Cross-referenceLiveBench题库持续更换,答案可以自动核对。用来看模型换题之后还能不能站住。LiveBench
- RankedArena Text真人匿名两两比较回答,看大家更愿意读哪一个。补上选择题看不出的整体体验。LMArenaEvidence budget 5%
- RankedArena WebDev同样是真人盲选,比的是网页好不好用、能不能交付。LMArenaEvidence budget 2.4%
- RankedLiveBench · 语言与指令Language + IF 两项均分,各占 50%。LiveBenchEvidence budget 3%
- RankedArena 创作盲选真人盲选故事、诗歌和其他创意表达,观察作品是否吸引读者。LMArenaEvidence budget 5%
- ObservingDesign Arena · 视觉设计真人盲选网页、界面、图表和幻灯片的设计作品。Design Arena / Intelligence
- ObservingEQ-Bench 4 · 情绪与人际理解在多轮交流中理解人物情绪、隐含需求与不同的沟通偏好。EQ-Bench
- ObservingShort-Story · 短篇小说把固定人物、情节与风格要求自然写进一篇完整短篇小说。Lech Mazur
- ObservingToneBench · 文风与脚本按指定作者文风写视频脚本,考查开场、结构、表达与口播节奏。Towards AI
- ObservingTubeLab · 视频脚本面向不同视频频道写脚本,比较故事组织、文风、节奏与清晰度。TubeLab
- ObservingNC Bench · 作家工作流帮助作家改写、续写、总结、翻译和整理创作想法。Novelcrafter
- ObservingOpenVibeEval · 网页作品对照网页作品、可访问性和盲选偏好,观察不同工具下的设计表现。OpenVibeEval
- ObservingSVGBench · 矢量图盲选按相同提示盲选 SVG,考查视觉清晰度与图形表现。SVGBench
- ObservingRapidata SVG真人比较模型生成的矢量图,直接评价视觉偏好。Rapidata
- RankedCreative Writing v3短篇创作与表达EQ-BenchEvidence budget 3.6%
- RankedLongform Writing长篇故事的连贯性与完整性EQ-BenchEvidence budget 2.4%
编程
13从写代码到改仓库,看模型能不能把软件做出来。
- RankedDeepSWE v1.1在统一的编程助手环境里改仓库、修缺陷,比较的是写代码的模型本身。DataCurveEvidence budget 3.6%
- RankedTapTap Maker在真实游戏引擎里用 Lua 写出能跑起来的功能。分数由引擎执行判定,不用另一个模型打分。TapTap MakerEvidence budget 3.6%
- RankedLiveBench · 编程综合Coding + Agentic Coding 两项均分,各占 50%。LiveBenchEvidence budget 2.4%
- ObservingHyper-τ-bench根据业务资料构建并测试能工作的客户服务代理。Sierra
- ObservingSWE-rebench持续收集真实仓库问题,比较模型在多种编程语言中的软件修复能力。Nebius
- ObservingLHTB在较长时间内持续使用终端,完成复杂工程与工具任务。Tencent HY / Lehigh 等
- Reference onlyTerminal-Bench 4保留模型搭配不同 Agent 在终端任务中的原始成绩,供交叉核对。Harbor / Terminal-Bench
- Reference onlyMirrorCode长时间的软件复现Epoch AI
- ObservingCode Migration软件迁移与接口改造Vals AI
- ObservingProgramBench完整程序的实现与交付Vals AI
- ObservingFrontierCode真实仓库任务的质量、测试与修改范围Cognition
- ObservingFrontierSWE v2长时间运行的工程实现与研究任务Proximal Labs
- ObservingWeirdML在陌生数据上实现机器学习方案WeirdML
推理
11数学、逻辑与陌生规则,看模型能不能想明白新问题。
- RankedLiveBench · 推理与数学Reasoning + Mathematics 两项均分,各占 50%。LiveBenchEvidence budget 4.2%
- ObservingSimpleBench用日常常识和逻辑问题,检验模型能否识别问题中的实际约束。SimpleBench
- RankedFrontierMath v2 · Tiers 1–3研究级数学推理Epoch AIEvidence budget 3.6%
- RankedFrontierMath v2 · Tier 4更高难度的数学研究题Epoch AIEvidence budget 1.2%
- RankedChess Puzzles根据文字棋局寻找正确走法Epoch AIEvidence budget 1.8%
- RankedMystery Game Puzzles从陌生规则推导正确行动Epoch AIEvidence budget 1.2%
- ObservingMathArena · ArXivLean用 Lean 验证数学证明MathArena / ETH Zurich
- ObservingMathArena · BrokenArXiv发现和修复数学证明中的错误MathArena / ETH Zurich
- ObservingMathArena · ArXivMath从近期数学论文提炼的新题MathArena / ETH Zurich
- ObservingARC-AGI-2从陌生规则中学习和泛化ARC Prize
- ObservingARC-AGI-3从陌生规则中学习和泛化ARC Prize
知识
5事实问答与研究生级科学知识,看知识掌握与回答准确性。
- ObservingFACTS Parametric不借助搜索工具回答世界事实问题,检验模型自身知识的准确性。Google DeepMind / Kaggle
- ObservingHumanity’s Last Exam横跨学科的高难度学术知识与推理。CAIS / Scale AI
- ObservingBullshitBench · 错误前提识别问题里的错误前提,观察模型会不会顺着错误继续编造。Peter Gostev / BullshitBench
- RankedSimpleQA Verified短问题的事实准确性Epoch AIEvidence budget 4%
- RankedGPQA Diamond研究生水平的物理、化学与生物知识Epoch AIEvidence budget 2%
专业办公
19金融分析、法律咨询与银行业务,看专业任务能否完成。
- RankedAPEX-Agents 1.1投行、咨询和法律里的长任务,看模型当助手能不能把一件完整的工作做完。MercorEvidence budget 4%
- RankedVals Finance Agent金融分析师的日常办公题,看研报、建模这类工作做得怎样。Vals AIEvidence budget 3%
- ObservingOfficeQA Pro从大量真实财务文件中检索、计算并回答问题。Databricks
- ObservingHarvey Legal Agent Benchmark处理法律资料并交付 Word、Excel、幻灯片等可审阅文件。Vals AI / Harvey
- ObservingMCP Atlas通过真实 MCP 服务检索资料、操作文档与数据库,完成跨软件任务。Scale AI
- ObservingFinanceBenchmark完成金融定价、资本计算和风控任务,用数值与代码执行结果核验。FinanceBenchmark
- ObservingPRBench · Legal回答真实法律工作中的复杂问题,检验专业判断和论证质量。Scale AI
- ObservingPRBench · Finance回答真实金融决策问题,检验专业判断、推导和风险说明。Scale AI
- ObservingSpreadsheetBench 2完成财务建模、修复工作簿和数据可视化的整套表格工作。SpreadsheetBench / Renmin University / AfterQuery
- ObservingVending-Bench 2经营模拟商店一年,处理采购、谈判、库存与定价。Andon Labs
- Awaiting dataτ³-Banking在统一工具环境中办理银行业务,检验规则理解、客户沟通与任务完成。SierraEvidence budget 2%
- Reference onlyEBR-bench在长任务中学习新规则并使用记忆Epoch AI
- ObservingExcel · EMB表格编辑与 Excel 办公Vals AI
- ObservingLegal Research法律检索和论证Vals AI
- ObservingTaxAgentBench税务专业问题Vals AI
- ObservingMedScribe临床记录整理与撰写Vals AI
- ObservingBioMysteryBench生物学研究推理Vals AI
- ObservingAutomationBench跨办公软件完成自动化工作Zapier
- ObservingTerminal-Bench Science在终端里完成科研任务Harbor
视觉理解
2理解图片的证据继续保留在综合榜;读懂图片与设计美观是不同能力。
中文与多语言
2语言基础的补充证据,不把英文写作表现当作中文能力。
Observing means data, runtime conditions or usage boundaries are still being checked and the source does not affect rankings. Repeated captures or display slices do not add voting weight; overlap between evaluations is reviewed continuously.