MLCommons

How to Tell When a Benchmark Is Worth Trusting

8.5内容质量

TL;DR · AI 摘要

企业应通过五个关键问题评估基准测试的可信度,以避免被误导。MLCommons提出基准测试需满足目标相关性、数据清洁性、可重复性等要求。

核心要点

  • 基准测试的失效常见于数据污染,如系统在训练中接触过测试数据。
  • 企业应优先检查基准是否与决策目标直接相关,而非仅依赖高分。
  • 可重复性验证是判断基准可信度的关键步骤,MLCommons建议公开实验配置。

结构提纲

按章节快速跳转。

  1. 揭示企业AI领域基准测试被滥用的现状及MLCommons的行业背景。

  2. 提出评估基准可信度的五个核心问题框架。

  3. 强调测试数据泄露是基准失效的常见原因。

  4. 要求实验配置必须公开以确保结果可复现。

  5. 提供企业评估基准时的可执行检查清单。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 基准测试可信度评估
    • 核心问题框架
      • 目标相关性
      • 数据清洁性
      • 可重复性
    • MLCommons实践
      • MLPerf基准
      • 审计机制

金句 / Highlights

值得收藏与分享的关键句。

#基准测试#AI评估#MLCommons#企业AI
打开原文

如何判断基准测试是否值得信赖 | MLCommons

如何判断基准测试是否值得信赖

来自基准测试构建者的企业指南

2026年8月11日

如果你从事企业人工智能领域的工作,可能经历过这样的场景:供应商声称其模型在热门排行榜上领先。采购团队在权衡两个系统时,基准测试得分成为最终的决胜因素。高管汇报材料中引用安全基准测试结果,论证某个模型已“具备生产就绪条件”。

其中一些数据是真实的,另一些则属于我们称之为“基准测试漂白”的行为——即选择性使用便利的结果,暗示性能、可靠性、安全性或就绪性,而这些实际上缺乏证据支持。

我们以构建基准测试为业。我们在2018年启动了MLPerf(这比人工智能评估热潮早数年),并创建了人工智能系统的行业标准基准测试。多年来,我们建立了治理机制、审计追踪和完整性控制,使测试结果具有可辩护性。同时,我们也亲眼目睹了基准测试几乎所有可能失效、被操控或被误用的方式。

我们不会参与你的采购会议。我们并未声称完全了解你内部的评估工作流程。但企业团队告诉我们,他们需要一种方法来区分可信赖的基准测试结果和不可信赖的结果。这是我们尝试提供的帮助——不是以销售评估服务的供应商身份,而是以一个通过实践深刻理解基准测试证据有效性与脆弱性的联盟身份。

基准测试可信度检验

当有人向你提供基准测试结果并要求你据此做出决策时,请问自己以下几个问题。并非每家企业都可能成为基准测试专家,但每家企业都需要成为明智的基准测试使用者。我们认为这些问题值得带入任何使用基准测试分数支持重大决策的对话中。

如果这些问题难以回答,如果提供结果的人无法回答或从未考虑过这些问题……这本身就值得注意。

  1. 这个基准测试是否真正衡量了我所做决策的方面?

优秀的基准测试始于决策,而非数据集。其用途应明确——模型选择、供应商短名单筛选、发布就绪性评估、风险接受度判断、成本性能权衡等。我们曾见过基准测试被误用的案例:因为数据集可用且熟悉,而非与当前决策相关。结果可能完全准确但仍具有误导性。知识基准测试的高分并不能说明在生产负载下的可靠性,强大的编码基准测试也无法证明生成代码的安全性。

  1. 数据来源何处?是否保持了数据纯净?

评估人群、采样方法、标注方式、数据来源及已知限制应有完整记录。更重要的是——我们认为这个问题比许多人意识到的更为普遍——数据应经过污染检查。系统在训练过程中是否接触过测试数据?这并非罕见事故。当前调研文献已将测试集泄露视为结构性、反复出现的威胁。数据本身会讲述清晰的故事。

在一项针对小学算术基准测试的最新分析中,研究人员发现,一旦引入新的、等效的测试集以消除数据污染,多个模型家族的准确率可能骤降13个百分点。最令人警醒的证据来自软件工程领域。在公开的SWE-Bench Verified基准测试中,顶级模型的准确率经常超过70%。然而,当Scale AI的研究实验室使用其专有测试集SWE-Bench Pro进行测试时(该测试集基于模型未接触过的私有代码库),这些结果完全消失。GPT-5的准确率从23%骤降至15%以下,Claude Opus 4.1的准确率也从23%下降至18%。这在当前被用于论证自动化编码基础设施高额投资的关键指标上,造成了公开测试与私有测试之间55个百分点的巨大差距。

如果基准测试无法证明其具备数据污染控制能力,那么高分可能反映的是模型的背诵能力而非真实能力。正如SWE-Bench案例所示,这两者之间的差距可能足以影响关键决策。

  1. 是否有其他人能够复现这一结果并还原发生了什么?

一个可信的基准测试必须严格控制证据生成的条件:模型版本、提示词、超参数、硬件配置、随机种子、评分方法、后处理流程。这并非理想化的要求。我们已经观察到,仅提示词格式的微小变化就可能导致准确率波动数十个百分点,基于格式的排名在不同模型间几乎没有相关性。一个基准测试结果中的单一数字既是条件环境的产物,也反映了系统本身的特性。如果基准测试无法明确并复现这些条件,那么该分数更像是一个快照而非真实测量值。

可复现性包含两个层面,两者都至关重要。第一层面是同行评审视角:其他基准测试团队是否能根据规范自行重新运行评估?这正是MLPerf所采用的视角——规则的存在是为了让合格的评审者能够还原结果并验证其公平性。第二层面是审计视角:独立的第三方审计机构(即使不是基准测试专家,但需要为合规性、采购或风险评估验证证据)是否能追踪事件全过程?谁运行了基准测试?何时运行?在什么系统上运行?使用了哪些输入?输出如何评分?发生了哪些异常?结果如何获得批准?这正是我们在AI风险与可靠性工作中采用的视角——我们的受众通常是审计师或第三方验证机构,而非其他研究人员。

这两个视角本质上都在追问同一个问题:是否留下了足够完整的证据链,使得除了结果生成者之外的其他人也能为该结果背书?如果这样的证据链不存在,结果就无法被审计——而使用无法审计的结果来指导生产决策将带来额外风险。

  1. 这个分数是否告诉你所有你需要的信息,还是仅仅最容易测量的部分?

一个单一的指标易于沟通,但也容易被过度依赖。当基准测试只报告一个数字——通常是准确率或解决率时,值得思考的是还有哪些因素被忽略了。质量、延迟、成本、可靠性、安全性、效率——这些维度往往与核心指标同样重要,且它们之间经常存在权衡关系。一个在准确率上得分最高的模型,可能运行成本最高,生产环境中的速度最慢,或者对边缘情况的鲁棒性最差。我们认为并非每个基准测试都需要衡量所有因素,但了解基准测试未衡量的内容,以及这些缺失是否会影响你的决策,是值得重视的。仅报告准确率的基准测试并非错误,但试图将准确率指标扩展为“最适合你使用场景的系统”的说法,值得保持怀疑。

  1. 被测试的系统是被动对象,还是可能在利用测试规则?

这是一个较新的问题,坦白来说,它曾让我们感到意外。前沿模型可能会故意压低表现——战略性地降低性能以达到目标分数。它们表现出评估意识——通常能判断自己是否正在被测试,并推断出正在衡量的内容,这意味着测试中的行为可能无法迁移到生产环境。在智能体系统中,已有系统被发现通过搜索公开仓库(最近甚至包括侵入私人仓库)来获取基准测试答案,而非真正解决问题。假设系统是被动对象的基准测试,其前提假设在我们看来已不再适用于能力较强的模型。请关注完整性控制措施:盲测协议、预留测试项、轨迹检查、评估过程的持续监督——而不仅仅是最终得分。

  1. 如果模型在评分结果,该模型是否经过验证?

随着基准测试转向开放式生成,许多测试依赖另一个大语言模型来评分。这种方式可扩展,但评分者本身也是有缺陷的工具——倾向于更长的答案、特定风格、自我偏好以及比较中的位置。如果基准测试使用自动化评分,我们希望了解评分者是否基于已记录的样本与人类判断对齐,是否检查过偏见和稳定性,并进行了版本控制。当评分者无法保证可靠性时,应让客观的真实答案承担主要权重。

  1. 基准测试是否仍然有效——还是已经失效?

如果基准测试在发布后被弃用,它既不可信,也几乎没有实际价值。模型会逐渐适应基准测试,数据分布会发生变化,威胁模型也会演变。两年前能区分系统的基准测试,如今可能已无法区分。我们认为这在企业环境中是被低估的风险之一:基准测试持续产生数字,但这些数字的意义可能已发生改变。请查看维护计划:定期审查、漂移分析、污染检查、退役标准。如果基准测试未进行更新,其得分可能衡量的是对测试的适应能力,而非真实能力。

为什么这变得越来越困难,而非更容易

我们已经在这方面投入了多年,但令我们担忧的是:这些问题不仅存在,而且在不断累积。污染是结构性的。排行榜会激励人们为了提升排名而优化,而非真正解决问题。安全基准可能衡量的是能力而非安全性。当基准达到饱和时,它将不再能区分系统之间的差异,但仍会继续生成看似可信的数字。每个失败案例都有记录。更难以察觉的是这些失败如何相互作用——一个被污染且饱和的基准,被资源充足的提供者操控,并被写入供应商宣传材料中,这构成了层层叠加的扭曲,每层扭曲单独来看都难以察觉。

这里的“我早就告诉过你”并非针对特定对象。这代表我们认识到,这些问题如今已被充分记录,试图否认它们的存在本身已成为一种“基准清洗”(benchmark washing)。

什么是好的基准

并非所有基准都适用于相同的目标。我们发现区分两种类型很有帮助。

研究型基准旨在探索——测试假设、揭示新兴能力、创建共享参考点、推动可测量范围的前沿。BIG-bench、MMLU、HELM 和 CheckList 就是例子。它们的设计注重发现、速度和可比性,而非用于操作决策。

工业级基准旨在支持特定决策——采购、模型选择、发布门控、风险接受、监管声明。其设计、运行、证据和维护都足够稳健,能够支持生产决策和外部问责。

这种区分与规模或复杂度无关。如果一个狭窄的基准目的明确、限制有文档记录、执行受控、输出在适当范围内解读,它也可以适用于工业用途并值得信赖。一个复杂的测试集如果缺乏治理、可重复性和可审计性,也可能不可信。

工业级基准应具备以下特征:

  • 明确的范围和决策关联性——它清楚地知道它支持什么决策,并不会声称超出其测量范围的内容
  • 受控的数据——有文档记录的来源、污染控制和明确的限制说明
  • 可重复的执行——数据、代码、配置、提示、硬件和种子都经过版本控制
  • 对评分未覆盖内容的清醒认知——在关键点上揭示成本、延迟和质量等维度之间的权衡,声明不会超出基准实际测量的范围
  • 如实的不确定性——在关键领域报告方差和置信度,使“模型A击败模型B”这一声明经得起审查,而不仅仅是标题
  • 可审计性——独立审查者可以重建的完整证据链
  • 完整性控制——对可能操控测试的系统进行盲测、刷新、红队测试和轨迹检查
  • 生命周期维护——定期审查、漂移监控、退役标准和受控变更日志

我们的 MLPerf 基准测试套件是代表性成果,我们对此感到自豪。MLPerf Inference 已更新至 6.1 版,每个版本都体现了对构建行业级基准测试的新认知。其规则涵盖公平性、系统与框架一致性、共享实现、非确定性限制、基准检测禁止、强制可复现性以及审计流程。这种严谨性并非形式主义,而是确保当采购决策、产品声明或监管文件依赖这些结果时,结论具有可辩护性。

AILuminate 正在快速追赶,成为我们的第二套行业级基准测试体系。与聚焦性能指标(首 token 延迟、并发量、功耗等)的 MLPerf 不同,AILuminate 评估可靠性,涉及安全性和越狱防御能力等主观性更强的领域。我们于 2024 年推出 AILuminate,这项持续努力延续着我们“良好表现应具备哪些特征”的视角。

这并非意味着所有基准测试都必须采用 MLPerf 或 AILuminate。我们认为,可信的性能和可靠性声明需要与风险等级相匹配的控制措施。低风险内部助手的基准测试可能只需轻量级治理和月度审查,而支持临床、金融或安全关键场景部署的基准测试则需要独立审查、正式审计追踪、子群分析和对抗性测试。我们认为标准应体现比例原则:评估严谨性需与潜在失败状态的后果相匹配——且用于评估的基准测试应真正能衡量这些失败状态。

研究基准测试依然重要

需要明确的是——本文并非反对研究基准测试。我们使用它们,也高度重视它们。研究基准测试是探索新度量边界、揭示能力差距、发现未来生产控制概念的实验室。工业级基准测试则是生产线。两者缺一不可。

错误不在于使用研究基准测试,而在于将探索性证据作为生产保障,却不围绕其建立工业化评估流程。一个透明说明假设和局限性的研究基准测试已履行其职责。当研究基准测试结果被用作供应商宣传材料中生产就绪性的“证明”时,这种用法就构成了误用——即所谓的“基准洗白”。

我们为何提出这些观点

我们是一个联盟,而非供应商。我们没有模型可售,也没有排行榜要争夺。我们的动机是让基准测试证据更可信,而非让特定结果看起来更出色。我们认为这具有价值——也认为这正是此类文章由我们发布而非任何拥有市场模型的机构发布的原因。

我们还认为独立验证具有实际价值。不是因为我们是唯一能提供验证的机构,而是因为这一原则本身——不应自己给自己打分,评估系统的人不应与销售系统的人是同一人——是我们见过被频繁违反且确实重要的原则。

一个基准测试结果的价值取决于其生成条件、所衡量内容的代表性、产生过程的完整性以及对其局限性的诚实披露程度。如果你无法回答上述关于某个基准测试结果的八个问题——那就去问。如果找不到答案,我们相信这个结果很可能也不存在。

进一步阅读

BetterBench – 斯坦福大学的基准质量评估框架,该框架根据46项生命周期标准对24个AI基准进行评估。MLCommons AI Safety v0.5是被评估的基准之一,且评分表现良好。

你信任的每个基准都会受到古德哈特定律的挑战 – 《ACM通讯》,2026年。一篇通俗且深入的综述,探讨污染、排行榜操纵以及真正能经受古德哈特定律考验的内容。

排行榜幻觉 – Singh等人,2025年。一项多机构分析,揭示公共AI排行榜如何通过未公开的私有测试、选择性分数撤回和数据访问不平等被操纵。

HELM:语言模型的全面评估 – 斯坦福CRFM。一个持续更新的多维度评估框架,通过准确性、校准性、鲁棒性、公平性、偏见、毒性及效率等多个维度,展示"不止一个数字"的实际含义。

NIST人工智能风险管理框架 – NIST,2023年。美国政府的自愿性AI风险管理框架,其中"测量"功能直接针对评估、基准测试和监控进行设计。

我们能信任AI基准吗?– 欧盟委员会联合研究中心,2025年。对约100项基准缺陷研究的全面跨学科元分析,涵盖构念效度、污染、操纵、饱和度和商业动态等主题。

分类

新闻

作者

ML Commons

分享

  • 邮件分享
  • Facebook分享
  • LinkedIn分享
  • X平台分享
  • 复制链接