3Xray 测试方法与指标说明
本页说明 3Xray 排行榜的展示规则、核心指标和比较方式,帮助你更清晰地理解不同模型配置的推理表现。
3Xray 排行榜展示规则
3Xray 以模型配置为单位整理和展示测试结果。一个模型可能具有多个推理档位或运行配置;当同一模型存在多条记录时,排行榜优先展示任务通过率最高的一条,任务通过率相同时展示平均运行成本更低的一条。
模型详情页会保留该配置的推理档位、通过率、置信区间、成本、输出量、步骤数和运行时长等指标,方便从能力与效率两个维度进行比较。
评测场景
3Xray 聚焦长周期软件工程任务中的模型推理表现。任务以真实开源项目为场景,并通过可执行验证检查结果是否满足预期行为。任务覆盖 TypeScript、Go、Python、JavaScript 和 Rust 等常见开发语言。
每个任务均固定在对应的代码版本中运行,以减少环境变化对结果的影响,让不同模型配置具备更稳定的可比性。
什么是任务通过率(Pass@1)
任务通过率是所有计分运行尝试中通过的比例,即通过次数 ÷ 计分尝试次数。该指标用于衡量模型在单次独立运行中完成任务的成功水平,3Xray 将其作为排行榜的核心能力指标。
什么是 95% 置信区间(± 百分比)
95% 置信区间反映同一配置在重复运行之间的成绩波动。详情页中的「重复测试轮次」展示实际运行轮数;区间越窄,说明该配置在多轮运行中的表现越稳定。它用于描述当前测试设置下的波动范围。
什么是 Pass@4
Pass@4 指一个任务在四次重复运行中至少有一次通过的任务占比。它回答的是「允许多次独立尝试时,有多少任务至少能解出一次」,因此通常高于 Pass@1。
平均运行成本、输出量与代理步数
平均运行成本表示每次计分运行的平均调用成本;平均输出量表示一次运行生成的输出 token 均值;平均代理步数表示一次运行中的智能体步骤均值。三者共同反映完成任务所需的资源投入与执行方式。
成本、输出量和步骤数应与通过率一起阅读:更高的资源投入不一定带来更高的任务通过率,而不同用户对速度、成本和稳定性的偏好也不同。
统一比较原则
3Xray 在统一的任务集、运行环境、公共提示与工具配置下整理模型结果,以尽量降低模型之外因素对比较的影响。模型版本、推理档位和运行策略仍会影响结果,因此排行榜展示的是具体模型配置在当前测试条件下的表现。
如何阅读排行榜
先通过任务通过率了解模型的完成能力,再结合置信区间判断稳定性,并使用单次平均运行成本、输出量、代理步数和运行时长评估效率。点击模型详情页,可以查看完整指标和当前配置的测试信息。