3Xray Compare

gpt-5-6-sol 与 kimi-k2-7-code 模型对比

横向比较 gpt-5-6-sol 与 kimi-k2-7-code 的能力表现、运行成本与执行效率;各项仅按客观数值展示。

从模型库选择
2 / 4 已选
选择要对比的模型
选择状态会保存在链接中,可直接分享。
gpt-5-6-sol kimi-k2-7-code
能力表现更高 / 排名更前 资源投入更省 仅按单项数值标记,不生成综合总分。

左右滑动表格可查看其余已选模型

指标 gpt-5-6-sol max kimi-k2-7-code
能力表现
当前排名越低越靠前 第 2 名排名更前 第 23 名
任务通过率(Pass@1)越高越好 72.7%表现更高 30.5%
95% 置信区间重复运行波动范围 69.8% – 75.5% 30.0% – 31.0%
Pass@4四次内至少一次通过 85.8%通过更高 61.1%
资源与效率
单次平均运行成本越低资源投入越少 $8.39 $2.82资源更省
平均输出量越低资源投入越少 暂无数据 暂无数据
平均代理步数越低资源投入越少 61资源更省 149
平均运行时长越低资源投入越少 19 分钟资源更省 36 分钟
测试信息
参与任务数 113113
计分尝试次数 450452
推理档位 max暂无数据