参与测试的模型

共 28 个模型。每个模型展示当前数据版本中任务通过率最高、同分时成本更低的一条配置;数据版本 2026-09-22,最近更新 2026-10-03 08:45。

选择模型进行对比 0 / 4 已选
选择排名模型本次尝试数单次平均成本 平均输出量平均代理步数任务通过率
1 gpt-6-astra gpt-6-astra xhigh 452 $4.43 暂无数据 29 74.12%
2 gemini-3-8-flash gemini-3-8-flash high 447 $2.36 暂无数据 166 73.83%
3 claude-opus-5 claude-opus-5 max 444 $11.84 暂无数据 99 73.65%
4 gpt-5-6-sol gpt-5-6-sol max 450 $8.39 暂无数据 61 72.67%
5 claude-fable-5 claude-fable-5 xhigh 452 $13.41 暂无数据 68 69.91%
6 gpt-5-6-terra gpt-5-6-terra max 451 $4.95 暂无数据 76 69.62%
7 glm-5-3 glm-5-3 max 451 $3.99 暂无数据 124 68.96%
8 kimi-k3 kimi-k3 max 451 $4.65 暂无数据 98 68.51%
9 grok-4-6 grok-4-6 medium 452 $3.45 暂无数据 70 67.48%
10 gpt-5-6-luna gpt-5-6-luna max 448 $3.03 暂无数据 102 67.19%
11 gpt-5-5 gpt-5-5 xhigh 452 $7.23 暂无数据 82 67.04%
12 gemini-3-7-flash gemini-3-7-flash medium 452 $2.03 暂无数据 117 65.49%
13 glm-5-3-flash glm-5-3-flash max 448 $0.48 暂无数据 123 63.39%
14 deepseek-v4-pro deepseek-v4-pro max 452 $0.24 暂无数据 155 62.83%
15 claude-opus-4-8 claude-opus-4-8 max 429 $13.22 暂无数据 120 58.97%
16 qwen3-8-max qwen3-8-max xhigh 449 $3.73 暂无数据 111 57.46%
17 muse-spark-1-2 muse-spark-1-2 xhigh 452 $3.70 暂无数据 101 54.87%
18 claude-sonnet-5 claude-sonnet-5 max 442 $26.40 暂无数据 268 53.85%
19 grok-4-5 grok-4-5 high 452 $2.42 暂无数据 61 53.76%
20 deepseek-v4-flash deepseek-v4-flash max 452 $0.10 暂无数据 153 53.32%
21 muse-spark-1-1 muse-spark-1-1 xhigh 452 $2.36 暂无数据 96 53.32%
22 gpt-5-4 gpt-5-4 xhigh 452 $5.65 暂无数据 70 51.77%
23 gemini-3-6-flash gemini-3-6-flash high 452 $4.42 暂无数据 117 46.68%
24 glm-5-2 glm-5-2 max 450 $3.92 暂无数据 129 43.78%
25 gemini-3-5-flash gemini-3-5-flash high 452 $3.45 暂无数据 105 36.06%
26 kimi-k2-7-code kimi-k2-7-code 452 $2.82 暂无数据 149 30.53%
27 claude-sonnet-4-6 claude-sonnet-4-6 high 451 $5.52 暂无数据 134 29.93%
28 gemini-3-1-pro-preview gemini-3-1-pro-preview high 452 $2.14 暂无数据 76 11.73%