Skip to content
Evaluation sources

Vals Finance Agent

Vals AI / 专业办公 · 金融分析师的日常办公题,看研报、建模这类工作做得怎样。

Official evaluation
On HOTAIRanked
Evidence budget3%
Upstream data09/29 08:00
Last successful sync10/01 20:05

What and how it measures

只取 Finance Agent v2 官方 Overall 正确率。

How this evidence is used

行业专业任务预算 3%;目前直接测金融,不宣称已经覆盖全部行业。

Evaluation results

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

Source rankSource modelRaw scoreRepresentative configuration
1google/gemini-4-argonGoogle65.4%High 推理
2google/gemini-3.8-flashGoogle61.4%High 推理
3meta/muse_spark_1_2Meta60.6%xHigh 推理
4meta/muse_spark_1_3_maxMeta60.0%Max 推理
5google/gemini-3.7-flashGoogle59.0%High 推理
7anthropic/claude-fable-5-1Anthropic58.9%Max 推理
8anthropic/claude-opus-5Anthropic58.6%Max 推理
9anthropic/claude-opus-5-5Anthropic58.6%Max 推理
10anthropic/claude-sonnet-5-5—58.1%Max 推理
11google/gemini-3.5-flashGoogle57.9%High 推理
12zai/glm-5.3-flashZ.ai57.9%Max 推理
13xiaomi/mimo-v2.6-proXiaomi57.3%来源默认配置
14meta/muse_spark_1_1Meta57.2%xHigh 推理
15anthropic/claude-fable-5Anthropic56.3%Max 推理
16google/gemini-3.6-flashGoogle56.3%High 推理
17xiaomi/mimo-v2.6-flashXiaomi56.3%来源默认配置
18zai/glm-5.3Z.ai55.8%Max 推理
19tencent/hy4-previewTencent55.1%来源默认配置
20openai/gpt-5.6-lunaOpenAI55.0%Max 推理
21ant/ling-3.0-flash-af-rc3Ant54.9%来源默认配置
22openai/gpt-5.6-terraOpenAI54.4%Max 推理
23kimi/kimi-k3Moonshot AI54.4%来源默认配置
24anthropic/claude-opus-4-8Anthropic53.9%Max 推理
25anthropic/claude-sonnet-5Anthropic53.9%Max 推理
26openai/gpt-5.6-solOpenAI53.8%Max 推理
27grok/grok-4.6xAI53.7%High 推理
28openai/gpt-6-astraOpenAI53.5%Max 推理
29deepseek/deepseek-v4.1-flashDeepSeek53.5%High 推理
30grok/grok-4.7xAI52.3%xHigh 推理
31openai/gpt-6.1-solOpenAI52.0%Max 推理
Evaluation limits and attribution

私有题不能逐题复算;与 APEX 同属办公任务,必须共用一组预算。

Data license: 官方公开结果;公开再展示保留官方署名,完整再分发授权仍以 Vals 条款为准

成绩由 Vals AI 发布,原始分数与 HOTAI 共识分使用不同尺度,不能直接相加。