3Xray · AI 模型推理表现
AI 大模型推理能力排行榜
汇集主流 AI 模型的任务通过率、运行成本与执行表现,让模型差异更容易比较。
3Xray 数据版本 2026-08-20 · 最近更新 2026-08-21 06:45
排行榜
比较范围
已选择 25 / 25 个模型
精细筛选按模型自定义选择 25 / 25 已选
Anthropic
OpenAI
Google
DeepSeek
xAI
月之暗面
通义千问
智谱
Muse
任务通过率 × 单次平均运行成本
横轴越左成本越低,纵轴越上通过率越高
图表较宽,可左右滑动查看完整坐标与模型标签
排名模型
通过率平均成本
平均输出量平均步数
1
claude-opus-5
[max]
74%
±4%
任务通过率 74%
单次平均成本 $11.84
平均输出量 —
平均步数 99
2
gpt-5-6-sol
[max]
73%
±3%
任务通过率 73%
单次平均成本 $8.39
平均输出量 —
平均步数 61
3
claude-fable-5
[xhigh]
70%
±3%
任务通过率 70%
单次平均成本 $13.41
平均输出量 —
平均步数 68
4
gpt-5-6-terra
[max]
70%
±3%
任务通过率 70%
单次平均成本 $4.95
平均输出量 —
平均步数 76
5
glm-5-3
[max]
69%
±3%
任务通过率 69%
单次平均成本 $3.99
平均输出量 —
平均步数 124
6
kimi-k3
[max]
69%
±5%
任务通过率 69%
单次平均成本 $4.65
平均输出量 —
平均步数 98
7
grok-4-6
[medium]
67%
±2%
任务通过率 67%
单次平均成本 $3.45
平均输出量 —
平均步数 70
8
gpt-5-6-luna
[max]
67%
±4%
任务通过率 67%
单次平均成本 $3.03
平均输出量 —
平均步数 102
9
gpt-5-5
[xhigh]
67%
±6%
任务通过率 67%
单次平均成本 $7.23
平均输出量 —
平均步数 82
10
gemini-3-7-flash
[medium]
65%
±3%
任务通过率 65%
单次平均成本 $2.03
平均输出量 —
平均步数 117
11
deepseek-v4-pro
[max]
63%
±6%
任务通过率 63%
单次平均成本 $0.24
平均输出量 —
平均步数 155
12
claude-opus-4-8
[max]
59%
±2%
任务通过率 59%
单次平均成本 $13.22
平均输出量 —
平均步数 120
13
qwen3-8-max
[xhigh]
57%
±3%
任务通过率 57%
单次平均成本 $3.73
平均输出量 —
平均步数 111
14
muse-spark-1-2
[xhigh]
55%
±2%
任务通过率 55%
单次平均成本 $3.70
平均输出量 —
平均步数 101
15
claude-sonnet-5
[max]
54%
±4%
任务通过率 54%
单次平均成本 $26.40
平均输出量 —
平均步数 268
16
grok-4-5
[high]
54%
±2%
任务通过率 54%
单次平均成本 $2.42
平均输出量 —
平均步数 61
17
deepseek-v4-flash
[max]
53%
±4%
任务通过率 53%
单次平均成本 $0.10
平均输出量 —
平均步数 153
18
muse-spark-1-1
[xhigh]
53%
±3%
任务通过率 53%
单次平均成本 $2.36
平均输出量 —
平均步数 96
19
gpt-5-4
[xhigh]
52%
±2%
任务通过率 52%
单次平均成本 $5.65
平均输出量 —
平均步数 70
20
gemini-3-6-flash
[high]
47%
±4%
任务通过率 47%
单次平均成本 $4.42
平均输出量 —
平均步数 117
21
glm-5-2
[max]
44%
±2%
任务通过率 44%
单次平均成本 $3.92
平均输出量 —
平均步数 129
22
gemini-3-5-flash
[high]
36%
±4%
任务通过率 36%
单次平均成本 $3.45
平均输出量 —
平均步数 105
23
kimi-k2-7-code
31%
±1%
任务通过率 31%
单次平均成本 $2.82
平均输出量 —
平均步数 149
24
claude-sonnet-4-6
[high]
30%
±4%
任务通过率 30%
单次平均成本 $5.52
平均输出量 —
平均步数 134
25
gemini-3-1-pro-preview
[high]
12%
±1%
任务通过率 12%
单次平均成本 $2.14
平均输出量 —
平均步数 76
3Xray 如何帮助你比较模型
3Xray 将主流 AI 大模型的推理表现、成本与执行效率集中呈现,帮助你在同一页面快速定位适合自身需求的模型配置。
- 能力表现:通过率与置信区间帮助你查看模型在任务中的稳定性与完成质量。
- 成本效率:单次平均运行成本与能力表现结合展示,便于识别更具性价比的配置。
- 输出与步骤:平均输出量、代理步数和运行时长帮助理解不同模型的执行方式。
- 配置透明:同一模型的不同推理档位会分别记录,排行榜优先展示通过率更高、同分时成本更低的配置。
所有指标均按照当前数据版本统一整理和展示,详细口径见3Xray 测试方法。
3Xray 数据版本:2026-08-20 · 最近更新:2026-08-21 06:45