Skip to content
Evaluation sources

Mercor APEX-Agents 1.1

Mercor / 专业办公 · 投行、咨询和法律里的长任务,看模型当助手能不能把一件完整的工作做完。

Official evaluation
On HOTAIRanked
Evidence budget4%
Upstream data09/08 08:00
Last successful sync10/01 20:05

What and how it measures

固定 1.1 数据集和官方 Loop 环境,采用 Pass@1 及其对应误差,按预先固定的推理档位选配置。Mean Score 是评分项平均完成度,不混作任务完成率。

How this evidence is used

固定 1.1 版官方 Loop 的 Pass@1,独占工具与办公预算中的 4%;另 2% 用于统一环境的银行业务任务。

Evaluation results

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

Source rankSource modelRaw scoreRepresentative configuration
1gemini-4-argonGoogle82.2%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
2claude-sonnet-5-5—75.5%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
3claude-opus-5-5Anthropic73.5%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
4claude-fable-5.1Anthropic68.6%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
5gemini-3.7-flashGoogle67.8%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
6claude-opus-5Anthropic65.8%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
7grok-4-6-xhighxAI65.3%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
8gpt-6-astra-maxOpenAI64.7%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
9gemini-3.8-flashGoogle64.3%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
10claude-fable-5Anthropic63.6%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
11qwen-3-8-max-xhighAlibaba63.3%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
12gpt-6-1-solOpenAI60.0%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
14muse-spark-1-3Meta58.6%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
15gpt-5.6-terra-maxOpenAI58.2%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
16glm-5-3Z.ai56.6%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
17grok-4-5xAI56.2%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
18deepseek-v4-flashDeepSeek55.3%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
19gpt-5.5-xhighOpenAI55.1%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
20grok-4.7xAI54.6%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
21claude-sonnet-5-maxAnthropic54.5%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
22gpt-6-solOpenAI54.3%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
23glm-5-3-flashZ.ai52.8%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
25responses/gpt-5.4OpenAI52.4%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
26gpt-5-6-sol-max-proOpenAI51.4%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
27kimi-k3Moonshot AI50.6%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
28claude-opus-4-7Anthropic49.2%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
29claude-opus-4-8Anthropic48.9%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
30qwen-3-8-27bAlibaba47.5%xHigh 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
31deepseek-v4-pro-08-13DeepSeek47.3%Max 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
32gemini-3.6-flashGoogle46.9%High 推理 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
Evaluation limits and attribution

限投行、咨询、法律任务;原页未提供逐型号评测日期,少量运行缺失的原因尚未公开。不能将此分数解释为所有办公工作的可靠性。

Data license: 官方公开结果;数据与代码许可不等于榜单再分发授权

成绩由 Mercor 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。