AI 大模型任务通过率排行榜

28 个模型 · 113 个任务 · 数据版本 2026-09-22 · 最近更新 2026-10-03 08:45

对比多个模型

比较范围 已选择 28 / 28 个模型
精细筛选按模型自定义选择 28 / 28 已选
选择会立即更新图表,无需提交
Anthropic 5 / 5 已选
OpenAI 6 / 6 已选
Google 5 / 5 已选
DeepSeek 2 / 2 已选
xAI 2 / 2 已选
月之暗面 2 / 2 已选
通义千问 1 / 1 已选
智谱 3 / 3 已选
Muse 2 / 2 已选

任务通过率 × 单次平均运行成本

横轴越左成本越低,纵轴越上通过率越高

共 28 个模型
每个点代表一个模型配置。横轴为对数成本刻度,纵轴为任务通过率。 0% 20% 40% 60% 80% 100% 0.1 0.2 0.5 1 2 5 10 20 单次平均运行成本(美元,对数刻度) 任务通过率(%) deepseek-v4-flash:任务通过率 53.32%,单次平均运行成本 $0.10 deepseek-v4-flash deepseek-v4-pro:任务通过率 62.83%,单次平均运行成本 $0.24 deepseek-v4-pro glm-5-3-flash:任务通过率 63.39%,单次平均运行成本 $0.48 glm-5-3-flash gemini-3-7-flash:任务通过率 65.49%,单次平均运行成本 $2.03 gemini-3-7-flash gemini-3-1-pro-preview:任务通过率 11.73%,单次平均运行成本 $2.14 gemini-3-1-pro-preview muse-spark-1-1:任务通过率 53.32%,单次平均运行成本 $2.36 muse-spark-1-1 gemini-3-8-flash:任务通过率 73.83%,单次平均运行成本 $2.36 gemini-3-8-flash grok-4-5:任务通过率 53.76%,单次平均运行成本 $2.42 grok-4-5 kimi-k2-7-code:任务通过率 30.53%,单次平均运行成本 $2.82 kimi-k2-7-code gpt-5-6-luna:任务通过率 67.19%,单次平均运行成本 $3.03 gpt-5-6-luna gemini-3-5-flash:任务通过率 36.06%,单次平均运行成本 $3.45 gemini-3-5-flash grok-4-6:任务通过率 67.48%,单次平均运行成本 $3.45 grok-4-6 muse-spark-1-2:任务通过率 54.87%,单次平均运行成本 $3.70 muse-spark-1-2 qwen3-8-max:任务通过率 57.46%,单次平均运行成本 $3.73 qwen3-8-max glm-5-2:任务通过率 43.78%,单次平均运行成本 $3.92 glm-5-2 glm-5-3:任务通过率 68.96%,单次平均运行成本 $3.99 gemini-3-6-flash:任务通过率 46.68%,单次平均运行成本 $4.42 gemini-3-6-flash gpt-6-astra:任务通过率 74.12%,单次平均运行成本 $4.43 gpt-6-astra kimi-k3:任务通过率 68.51%,单次平均运行成本 $4.65 kimi-k3 gpt-5-6-terra:任务通过率 69.62%,单次平均运行成本 $4.95 gpt-5-6-terra claude-sonnet-4-6:任务通过率 29.93%,单次平均运行成本 $5.52 claude-sonnet-4-6 gpt-5-4:任务通过率 51.77%,单次平均运行成本 $5.65 gpt-5-4 gpt-5-5:任务通过率 67.04%,单次平均运行成本 $7.23 gpt-5-5 gpt-5-6-sol:任务通过率 72.67%,单次平均运行成本 $8.39 gpt-5-6-sol claude-opus-5:任务通过率 73.65%,单次平均运行成本 $11.84 claude-opus-5 claude-opus-4-8:任务通过率 58.97%,单次平均运行成本 $13.22 claude-opus-4-8 claude-fable-5:任务通过率 69.91%,单次平均运行成本 $13.41 claude-fable-5 claude-sonnet-5:任务通过率 53.85%,单次平均运行成本 $26.40 claude-sonnet-5

图表较宽,可左右滑动查看完整坐标与模型标签

排名模型相对通过率 通过率平均成本 平均输出量平均步数
1 gpt-6-astra [xhigh] 74% ±3%
任务通过率 74% 单次平均成本 $4.43 平均输出量 — 平均步数 29
2 gemini-3-8-flash [high] 74% ±1%
任务通过率 74% 单次平均成本 $2.36 平均输出量 — 平均步数 166
3 claude-opus-5 [max] 74% ±4%
任务通过率 74% 单次平均成本 $11.84 平均输出量 — 平均步数 99
4 gpt-5-6-sol [max] 73% ±3%
任务通过率 73% 单次平均成本 $8.39 平均输出量 — 平均步数 61
5 claude-fable-5 [xhigh] 70% ±3%
任务通过率 70% 单次平均成本 $13.41 平均输出量 — 平均步数 68
6 gpt-5-6-terra [max] 70% ±3%
任务通过率 70% 单次平均成本 $4.95 平均输出量 — 平均步数 76
7 glm-5-3 [max] 69% ±3%
任务通过率 69% 单次平均成本 $3.99 平均输出量 — 平均步数 124
8 kimi-k3 [max] 69% ±5%
任务通过率 69% 单次平均成本 $4.65 平均输出量 — 平均步数 98
9 grok-4-6 [medium] 67% ±2%
任务通过率 67% 单次平均成本 $3.45 平均输出量 — 平均步数 70
10 gpt-5-6-luna [max] 67% ±4%
任务通过率 67% 单次平均成本 $3.03 平均输出量 — 平均步数 102
11 gpt-5-5 [xhigh] 67% ±6%
任务通过率 67% 单次平均成本 $7.23 平均输出量 — 平均步数 82
12 gemini-3-7-flash [medium] 65% ±3%
任务通过率 65% 单次平均成本 $2.03 平均输出量 — 平均步数 117
13 glm-5-3-flash [max] 63% ±4%
任务通过率 63% 单次平均成本 $0.48 平均输出量 — 平均步数 123
14 deepseek-v4-pro [max] 63% ±6%
任务通过率 63% 单次平均成本 $0.24 平均输出量 — 平均步数 155
15 claude-opus-4-8 [max] 59% ±2%
任务通过率 59% 单次平均成本 $13.22 平均输出量 — 平均步数 120
16 qwen3-8-max [xhigh] 57% ±3%
任务通过率 57% 单次平均成本 $3.73 平均输出量 — 平均步数 111
17 muse-spark-1-2 [xhigh] 55% ±2%
任务通过率 55% 单次平均成本 $3.70 平均输出量 — 平均步数 101
18 claude-sonnet-5 [max] 54% ±4%
任务通过率 54% 单次平均成本 $26.40 平均输出量 — 平均步数 268
19 grok-4-5 [high] 54% ±2%
任务通过率 54% 单次平均成本 $2.42 平均输出量 — 平均步数 61
20 deepseek-v4-flash [max] 53% ±4%
任务通过率 53% 单次平均成本 $0.10 平均输出量 — 平均步数 153
21 muse-spark-1-1 [xhigh] 53% ±3%
任务通过率 53% 单次平均成本 $2.36 平均输出量 — 平均步数 96
22 gpt-5-4 [xhigh] 52% ±2%
任务通过率 52% 单次平均成本 $5.65 平均输出量 — 平均步数 70
23 gemini-3-6-flash [high] 47% ±4%
任务通过率 47% 单次平均成本 $4.42 平均输出量 — 平均步数 117
24 glm-5-2 [max] 44% ±2%
任务通过率 44% 单次平均成本 $3.92 平均输出量 — 平均步数 129
25 gemini-3-5-flash [high] 36% ±4%
任务通过率 36% 单次平均成本 $3.45 平均输出量 — 平均步数 105
26 kimi-k2-7-code 31% ±1%
任务通过率 31% 单次平均成本 $2.82 平均输出量 — 平均步数 149
27 claude-sonnet-4-6 [high] 30% ±4%
任务通过率 30% 单次平均成本 $5.52 平均输出量 — 平均步数 134
28 gemini-3-1-pro-preview [high] 12% ±1%
任务通过率 12% 单次平均成本 $2.14 平均输出量 — 平均步数 76

条形长度为任务通过率(按当前最高值归一化),竖线为该模型的平均单次运行成本在对数成本轴上的位置;同一模型若有多个推理档位,3Xray 优先展示任务通过率最高、同分时成本更低的配置。