← 返回模型列表

grok-4-5grok-4-5high

第 15 名
当前排名
54%±2%
能力得分
$2.42
平均运行成本
36k
平均输出量
61
平均执行步数
113
参与测试数量

测试详情

推理档位high

95% 置信区间51.5% - 56.0%

Pass@477.9%

尝试次数452

通过任务数243

至少通过一次的任务数88

平均输入量4059k

中位峰值上下文94k

中位运行成本$2.02

中位输出量34k

平均运行时长8 分钟

重复测试轮次4

任务集规模113

数据更新时间2026-08-13

数据生成时间2026-08-13