参与模型

共 24 个参与模型(24 个测试记录)。

排名模型测试次数平均运行成本 平均输出量平均执行步数最高能力得分
1 claude-opus-5 claude-opus-5 max 1 $11.84 118k 99 73.65%
2 gpt-5-6-sol gpt-5-6-sol max 1 $8.39 60k 61 72.67%
3 claude-fable-5 claude-fable-5 xhigh 1 $13.41 80k 68 69.91%
4 gpt-5-6-terra gpt-5-6-terra max 1 $4.95 72k 76 69.62%
5 kimi-k3 kimi-k3 max 1 $4.65 81k 98 68.51%
6 grok-4-6 grok-4-6 medium 1 $3.45 50k 70 67.48%
7 gpt-5-6-luna gpt-5-6-luna max 1 $3.03 73k 102 67.19%
8 gpt-5-5 gpt-5-5 xhigh 1 $7.23 46k 82 67.04%
9 gemini-3-7-flash gemini-3-7-flash medium 1 $2.03 94k 117 65.49%
10 deepseek-v4-pro deepseek-v4-pro max 1 $0.24 106k 155 62.83%
11 claude-opus-4-8 claude-opus-4-8 max 1 $13.22 135k 120 58.97%
12 qwen3-8-max qwen3-8-max xhigh 1 $3.73 95k 111 57.46%
13 muse-spark-1-2 muse-spark-1-2 xhigh 1 $3.70 99k 101 54.87%
14 claude-sonnet-5 claude-sonnet-5 max 1 $26.40 214k 268 53.85%
15 grok-4-5 grok-4-5 high 1 $2.42 36k 61 53.76%
16 deepseek-v4-flash deepseek-v4-flash max 1 $0.10 108k 153 53.32%
17 muse-spark-1-1 muse-spark-1-1 xhigh 1 $2.36 74k 96 53.32%
18 gpt-5-4 gpt-5-4 xhigh 1 $5.65 71k 70 51.77%
19 gemini-3-6-flash gemini-3-6-flash high 1 $4.42 96k 117 46.68%
20 glm-5-2 glm-5-2 max 1 $3.92 78k 129 43.78%
21 gemini-3-5-flash gemini-3-5-flash high 1 $3.45 76k 105 36.06%
22 kimi-k2-7-code kimi-k2-7-code 1 $2.82 59k 149 30.53%
23 claude-sonnet-4-6 claude-sonnet-4-6 high 1 $5.52 76k 134 29.93%
24 gemini-3-1-pro-preview gemini-3-1-pro-preview high 1 $2.14 28k 76 11.73%