3Xray · AI 模型推理表现

AI 大模型推理能力排行榜

汇集主流 AI 模型的任务通过率、运行成本与执行表现,让模型差异更容易比较。

了解 3Xray 测试方法与指标说明 →

3Xray 数据版本 2026-08-20 · 最近更新 2026-08-21 06:45

排行榜

25 个模型 · 113 个任务 · 数据版本 2026-08-20 · 最近更新 2026-08-21 06:45
比较范围 已选择 25 / 25 个模型
精细筛选按模型自定义选择 25 / 25 已选
选择会立即更新图表,无需提交
Anthropic 5 / 5 已选
OpenAI 5 / 5 已选
Google 4 / 4 已选
DeepSeek 2 / 2 已选
xAI 2 / 2 已选
月之暗面 2 / 2 已选
通义千问 1 / 1 已选
智谱 2 / 2 已选
Muse 2 / 2 已选

任务通过率 × 单次平均运行成本

横轴越左成本越低,纵轴越上通过率越高

共 25 个模型
每个点代表一个模型配置。横轴为对数成本刻度,纵轴为任务通过率。 0% 20% 40% 60% 80% 100% 0.1 0.2 0.5 1 2 5 10 20 单次平均运行成本(美元,对数刻度) 任务通过率(%) deepseek-v4-flash:任务通过率 53.32%,单次平均运行成本 $0.10 deepseek-v4-flash deepseek-v4-pro:任务通过率 62.83%,单次平均运行成本 $0.24 deepseek-v4-pro gemini-3-7-flash:任务通过率 65.49%,单次平均运行成本 $2.03 gemini-3-7-flash gemini-3-1-pro-preview:任务通过率 11.73%,单次平均运行成本 $2.14 gemini-3-1-pro-preview muse-spark-1-1:任务通过率 53.32%,单次平均运行成本 $2.36 muse-spark-1-1 grok-4-5:任务通过率 53.76%,单次平均运行成本 $2.42 grok-4-5 kimi-k2-7-code:任务通过率 30.53%,单次平均运行成本 $2.82 kimi-k2-7-code gpt-5-6-luna:任务通过率 67.19%,单次平均运行成本 $3.03 gpt-5-6-luna gemini-3-5-flash:任务通过率 36.06%,单次平均运行成本 $3.45 gemini-3-5-flash grok-4-6:任务通过率 67.48%,单次平均运行成本 $3.45 grok-4-6 muse-spark-1-2:任务通过率 54.87%,单次平均运行成本 $3.70 muse-spark-1-2 qwen3-8-max:任务通过率 57.46%,单次平均运行成本 $3.73 qwen3-8-max glm-5-2:任务通过率 43.78%,单次平均运行成本 $3.92 glm-5-2 glm-5-3:任务通过率 68.96%,单次平均运行成本 $3.99 glm-5-3 gemini-3-6-flash:任务通过率 46.68%,单次平均运行成本 $4.42 gemini-3-6-flash kimi-k3:任务通过率 68.51%,单次平均运行成本 $4.65 kimi-k3 gpt-5-6-terra:任务通过率 69.62%,单次平均运行成本 $4.95 gpt-5-6-terra claude-sonnet-4-6:任务通过率 29.93%,单次平均运行成本 $5.52 claude-sonnet-4-6 gpt-5-4:任务通过率 51.77%,单次平均运行成本 $5.65 gpt-5-4 gpt-5-5:任务通过率 67.04%,单次平均运行成本 $7.23 gpt-5-5 gpt-5-6-sol:任务通过率 72.67%,单次平均运行成本 $8.39 gpt-5-6-sol claude-opus-5:任务通过率 73.65%,单次平均运行成本 $11.84 claude-opus-5 claude-opus-4-8:任务通过率 58.97%,单次平均运行成本 $13.22 claude-opus-4-8 claude-fable-5:任务通过率 69.91%,单次平均运行成本 $13.41 claude-fable-5 claude-sonnet-5:任务通过率 53.85%,单次平均运行成本 $26.40 claude-sonnet-5

图表较宽,可左右滑动查看完整坐标与模型标签

排名模型相对通过率 通过率平均成本 平均输出量平均步数
1 claude-opus-5 [max] 74% ±4%
任务通过率 74% 单次平均成本 $11.84 平均输出量 平均步数 99
2 gpt-5-6-sol [max] 73% ±3%
任务通过率 73% 单次平均成本 $8.39 平均输出量 平均步数 61
3 claude-fable-5 [xhigh] 70% ±3%
任务通过率 70% 单次平均成本 $13.41 平均输出量 平均步数 68
4 gpt-5-6-terra [max] 70% ±3%
任务通过率 70% 单次平均成本 $4.95 平均输出量 平均步数 76
5 glm-5-3 [max] 69% ±3%
任务通过率 69% 单次平均成本 $3.99 平均输出量 平均步数 124
6 kimi-k3 [max] 69% ±5%
任务通过率 69% 单次平均成本 $4.65 平均输出量 平均步数 98
7 grok-4-6 [medium] 67% ±2%
任务通过率 67% 单次平均成本 $3.45 平均输出量 平均步数 70
8 gpt-5-6-luna [max] 67% ±4%
任务通过率 67% 单次平均成本 $3.03 平均输出量 平均步数 102
9 gpt-5-5 [xhigh] 67% ±6%
任务通过率 67% 单次平均成本 $7.23 平均输出量 平均步数 82
10 gemini-3-7-flash [medium] 65% ±3%
任务通过率 65% 单次平均成本 $2.03 平均输出量 平均步数 117
11 deepseek-v4-pro [max] 63% ±6%
任务通过率 63% 单次平均成本 $0.24 平均输出量 平均步数 155
12 claude-opus-4-8 [max] 59% ±2%
任务通过率 59% 单次平均成本 $13.22 平均输出量 平均步数 120
13 qwen3-8-max [xhigh] 57% ±3%
任务通过率 57% 单次平均成本 $3.73 平均输出量 平均步数 111
14 muse-spark-1-2 [xhigh] 55% ±2%
任务通过率 55% 单次平均成本 $3.70 平均输出量 平均步数 101
15 claude-sonnet-5 [max] 54% ±4%
任务通过率 54% 单次平均成本 $26.40 平均输出量 平均步数 268
16 grok-4-5 [high] 54% ±2%
任务通过率 54% 单次平均成本 $2.42 平均输出量 平均步数 61
17 deepseek-v4-flash [max] 53% ±4%
任务通过率 53% 单次平均成本 $0.10 平均输出量 平均步数 153
18 muse-spark-1-1 [xhigh] 53% ±3%
任务通过率 53% 单次平均成本 $2.36 平均输出量 平均步数 96
19 gpt-5-4 [xhigh] 52% ±2%
任务通过率 52% 单次平均成本 $5.65 平均输出量 平均步数 70
20 gemini-3-6-flash [high] 47% ±4%
任务通过率 47% 单次平均成本 $4.42 平均输出量 平均步数 117
21 glm-5-2 [max] 44% ±2%
任务通过率 44% 单次平均成本 $3.92 平均输出量 平均步数 129
22 gemini-3-5-flash [high] 36% ±4%
任务通过率 36% 单次平均成本 $3.45 平均输出量 平均步数 105
23 kimi-k2-7-code 31% ±1%
任务通过率 31% 单次平均成本 $2.82 平均输出量 平均步数 149
24 claude-sonnet-4-6 [high] 30% ±4%
任务通过率 30% 单次平均成本 $5.52 平均输出量 平均步数 134
25 gemini-3-1-pro-preview [high] 12% ±1%
任务通过率 12% 单次平均成本 $2.14 平均输出量 平均步数 76

3Xray 如何帮助你比较模型

3Xray 将主流 AI 大模型的推理表现、成本与执行效率集中呈现,帮助你在同一页面快速定位适合自身需求的模型配置。

  • 能力表现:通过率与置信区间帮助你查看模型在任务中的稳定性与完成质量。
  • 成本效率:单次平均运行成本与能力表现结合展示,便于识别更具性价比的配置。
  • 输出与步骤:平均输出量、代理步数和运行时长帮助理解不同模型的执行方式。
  • 配置透明:同一模型的不同推理档位会分别记录,排行榜优先展示通过率更高、同分时成本更低的配置。

所有指标均按照当前数据版本统一整理和展示,详细口径见3Xray 测试方法

3Xray 数据版本:2026-08-20 · 最近更新:2026-08-21 06:45