3Xray Compare
grok-4-5 与 kimi-k2-7-code 模型对比
横向比较 grok-4-5 与 kimi-k2-7-code 的能力表现、运行成本与执行效率;各项仅按客观数值展示。
能力表现更高 / 排名更前
资源投入更省
仅按单项数值标记,不生成综合总分。
左右滑动表格可查看其余已选模型
| 指标 |
|
|
|---|---|---|
| 能力表现 | ||
| 当前排名越低越靠前 | 第 16 名排名更前 | 第 23 名 |
| 任务通过率(Pass@1)越高越好 | 53.8%表现更高 | 30.5% |
| 95% 置信区间重复运行波动范围 | 51.5% – 56.0% | 30.0% – 31.0% |
| Pass@4四次内至少一次通过 | 77.9%通过更高 | 61.1% |
| 资源与效率 | ||
| 单次平均运行成本越低资源投入越少 | $2.42资源更省 | $2.82 |
| 平均输出量越低资源投入越少 | 暂无数据 | 暂无数据 |
| 平均代理步数越低资源投入越少 | 61资源更省 | 149 |
| 平均运行时长越低资源投入越少 | 8 分钟资源更省 | 36 分钟 |
| 测试信息 | ||
| 参与任务数 | 113 | 113 |
| 计分尝试次数 | 452 | 452 |
| 推理档位 | high | 暂无数据 |