排行榜
按模型自定义选择
Anthropic
OpenAI
Google
DeepSeek
xAI
月之暗面
通义千问
智谱
Muse
推理能力 × 平均运行成本
共 24 个模型
排名模型
能力得分平均成本
平均输出量平均步数
1
claude-opus-5
[max]
74%
±4%
能力得分 74%
平均成本 $11.84
平均输出量 118k
平均步数 99
2
gpt-5-6-sol
[max]
73%
±3%
能力得分 73%
平均成本 $8.39
平均输出量 60k
平均步数 61
3
claude-fable-5
[xhigh]
70%
±3%
能力得分 70%
平均成本 $13.41
平均输出量 80k
平均步数 68
4
gpt-5-6-terra
[max]
70%
±3%
能力得分 70%
平均成本 $4.95
平均输出量 72k
平均步数 76
5
kimi-k3
[max]
69%
±5%
能力得分 69%
平均成本 $4.65
平均输出量 81k
平均步数 98
6
grok-4-6
[medium]
67%
±2%
能力得分 67%
平均成本 $3.45
平均输出量 50k
平均步数 70
7
gpt-5-6-luna
[max]
67%
±4%
能力得分 67%
平均成本 $3.03
平均输出量 73k
平均步数 102
8
gpt-5-5
[xhigh]
67%
±6%
能力得分 67%
平均成本 $7.23
平均输出量 46k
平均步数 82
9
gemini-3-7-flash
[medium]
65%
±3%
能力得分 65%
平均成本 $2.03
平均输出量 94k
平均步数 117
10
deepseek-v4-pro
[max]
63%
±6%
能力得分 63%
平均成本 $0.24
平均输出量 106k
平均步数 155
11
claude-opus-4-8
[max]
59%
±2%
能力得分 59%
平均成本 $13.22
平均输出量 135k
平均步数 120
12
qwen3-8-max
[xhigh]
57%
±3%
能力得分 57%
平均成本 $3.73
平均输出量 95k
平均步数 111
13
muse-spark-1-2
[xhigh]
55%
±2%
能力得分 55%
平均成本 $3.70
平均输出量 99k
平均步数 101
14
claude-sonnet-5
[max]
54%
±4%
能力得分 54%
平均成本 $26.40
平均输出量 214k
平均步数 268
15
grok-4-5
[high]
54%
±2%
能力得分 54%
平均成本 $2.42
平均输出量 36k
平均步数 61
16
muse-spark-1-1
[xhigh]
53%
±3%
能力得分 53%
平均成本 $2.36
平均输出量 74k
平均步数 96
17
deepseek-v4-flash
[max]
53%
±4%
能力得分 53%
平均成本 $0.10
平均输出量 108k
平均步数 153
18
gpt-5-4
[xhigh]
52%
±2%
能力得分 52%
平均成本 $5.65
平均输出量 71k
平均步数 70
19
gemini-3-6-flash
[high]
47%
±4%
能力得分 47%
平均成本 $4.42
平均输出量 96k
平均步数 117
20
glm-5-2
[max]
44%
±2%
能力得分 44%
平均成本 $3.92
平均输出量 78k
平均步数 129
21
gemini-3-5-flash
[high]
36%
±4%
能力得分 36%
平均成本 $3.45
平均输出量 76k
平均步数 105
22
kimi-k2-7-code
31%
±1%
能力得分 31%
平均成本 $2.82
平均输出量 59k
平均步数 149
23
claude-sonnet-4-6
[high]
30%
±4%
能力得分 30%
平均成本 $5.52
平均输出量 76k
平均步数 134
24
gemini-3-1-pro-preview
[high]
12%
±1%
能力得分 12%
平均成本 $2.14
平均输出量 28k
平均步数 76
条形长度为能力得分(按最高模型归一化),竖线为该模型的平均运行成本在成本轴上的位置;同一模型以多个推理档位参与测试,本表展示能力得分最高的档位成绩。成绩反映特定任务集、测试环境和运行方式下的表现,不代表模型综合能力的绝对排名。