跳到正文
评测来源

Vals Finance Agent

Vals AI / 专业办公 · 金融分析师的日常办公题,看研报、建模这类工作做得怎样。

官方评测
在 WebAi 中参与排名
证据预算3%
上游数据时间09/27 08:00
最近成功同步09/29 22:55

它测什么,怎么测

只取 Finance Agent v2 官方 Overall 正确率。

如何使用这份证据

行业专业任务预算 3%;目前直接测金融,不宣称已经覆盖全部行业。

评测成绩

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1google/gemini-3.8-flashGoogle61.4%High 推理
2meta/muse_spark_1_2Meta60.6%xHigh 推理
3meta/muse_spark_1_3_maxMeta60.0%Max 推理
4google/gemini-3.7-flashGoogle59.0%High 推理
6anthropic/claude-fable-5-1Anthropic58.9%Max 推理
7anthropic/claude-opus-5Anthropic58.6%Max 推理
8anthropic/claude-opus-5-5Anthropic58.6%Max 推理
9anthropic/claude-sonnet-5-5—58.1%Max 推理
10google/gemini-3.5-flashGoogle57.9%High 推理
11zai/glm-5.3-flashZ.ai57.9%Max 推理
12xiaomi/mimo-v2.6-proXiaomi57.3%来源默认配置
13meta/muse_spark_1_1Meta57.2%xHigh 推理
14anthropic/claude-fable-5Anthropic56.3%Max 推理
15google/gemini-3.6-flashGoogle56.3%High 推理
16xiaomi/mimo-v2.6-flashXiaomi56.3%来源默认配置
17zai/glm-5.3Z.ai55.8%Max 推理
18tencent/hy4-previewTencent55.1%来源默认配置
19openai/gpt-5.6-lunaOpenAI55.0%Max 推理
20ant/ling-3.0-flash-af-rc3Ant54.9%来源默认配置
21openai/gpt-5.6-terraOpenAI54.4%Max 推理
22kimi/kimi-k3Moonshot AI54.4%来源默认配置
23anthropic/claude-opus-4-8Anthropic53.9%Max 推理
24anthropic/claude-sonnet-5Anthropic53.9%Max 推理
25openai/gpt-5.6-solOpenAI53.8%Max 推理
26grok/grok-4.6xAI53.7%High 推理
27openai/gpt-6-astraOpenAI53.5%Max 推理
28deepseek/deepseek-v4.1-flashDeepSeek53.5%High 推理
29grok/grok-4.7xAI52.3%xHigh 推理
30openai/gpt-5.5OpenAI51.8%xHigh 推理
31anthropic/claude-opus-4-7Anthropic51.5%High 推理
评测局限与数据署名

私有题不能逐题复算;与 APEX 同属办公任务,必须共用一组预算。

数据许可:官方公开结果;公开再展示保留官方署名,完整再分发授权仍以 Vals 条款为准

成绩由 Vals AI 发布,原始分数与 WebAi 共识分使用不同尺度,不能直接相加。