← 返回模型列表

gpt-5-6-lunagpt-5-6-lunamax

第 7 名
当前排名
67%±4%
能力得分
$3.03
平均运行成本
73k
平均输出量
102
平均执行步数
113
参与测试数量

测试详情

推理档位max

95% 置信区间63.2% - 71.2%

Pass@490.3%

尝试次数448

通过任务数301

至少通过一次的任务数102

平均输入量15444k

中位峰值上下文202k

中位运行成本$2.29

中位输出量70k

平均运行时长19 分钟

重复测试轮次4

任务集规模113

数据更新时间2026-08-13

数据生成时间2026-08-13