测试方法
本页用中文解释本站展示的基准测试指标含义,帮助理解模型成绩。
什么是基准测试
基准测试(Benchmark)是一组预先定义好的任务集合,用于在相同条件下测量人工智能模型的特定能力。测试时,模型需要按规则完成任务,评测程序根据任务完成情况给出通过或未通过的判定,并统计成本、输出量、执行步数等运行信息。
什么是通过率(Pass@1)
通过率指模型单次运行解决任务的成功率的估计值。每个模型配置会完整重复运行多轮(当前为 4 轮),通过率 = 通过次数 ÷ 总尝试次数(任务数 × 轮数),因此可能出现小数。通过率越高,说明模型在该任务集上的成功率越高。通过率的数值只反映该任务集下的表现,不直接等于模型综合能力。
什么是置信区间(± 百分比)
排行榜通过率旁的「±x%」是 95% 置信区间:由多轮完整重复运行之间的成绩波动计算(1.96 × 各轮通过率的标准差 ÷ √轮数),反映同一配置重复测试的自然波动范围。当两个模型的置信区间有明显重叠时,其名次先后不一定具有统计意义。
什么是 Pass@4
模型详情页的 Pass@4 表示在四次重复运行中至少通过一次的任务占比,衡量「多试几次能解出多少任务」,通常明显高于 Pass@1。
什么是平均运行成本
平均运行成本指模型完成单个任务平均消耗的调用费用,按任务执行过程中的输入、输出量与模型公开计费价格计算;详情页同时展示中位数。成本数值受任务类型、模型计费规则影响,仅供参考。
什么是输出量
输出量指模型执行任务时平均生成的输出内容数量,以 token(词元)为单位计量,详情页同时展示中位数。输出量反映模型完成任务时生成内容的规模,输出量大不意味着质量更高。
什么是执行步数
执行步数指模型在解决单个任务过程中的平均执行步骤数量。本榜所有模型都在完全相同的开源智能体框架下运行——使用相同的工具与提示词——因此各模型的步数与成绩可以直接比较,差异反映的是模型本身的能力,而非外围运行框架的差别。
测试任务是什么
测试任务是在真实开源代码仓库上从头编写的原创长周期软件工程任务(例如新功能开发、工程改造),不从已有提交或 PR 改编,模型在训练数据中不会见到任务答案。每个任务配有专门编写的验证程序,只检验软件行为是否符合要求,而不比对具体实现方式;提交的修改若破坏了已有功能,则判定为失败。
为什么不同模型会有不同结果
模型架构、训练数据、推理策略、运行环境与任务处理方式都会影响测试结果。同样的任务在不同条件下运行,成绩也可能不同。同一模型还可能以不同推理档位(思考强度)多次参与测试,本站展示其通过率最高的档位成绩。本站展示的数据均为真实测试成绩,反映特定任务集、测试环境和运行方式下的表现。