MLCommons Releases MLPerf Training v6.0 Results

TL;DR · AI 摘要
MLPerf v6.0新增稀疏计算基准,推动AI系统多样性,DeepSeek V3参数达6710亿。
核心要点
- DeepSeek V3使用6710亿参数,激活370亿参数/令牌,验证大规模稀疏训练系统。
- GPT-OSS 20B以210亿总参数和3.6亿激活参数,适配单8-GPU节点评估。
- MoE架构通过智能路由实现计算效率提升,成为主流生成模型架构。
结构提纲
按章节快速跳转。
- §引言
DeepSeek V3和GPT-OSS 20B基准体现稀疏计算趋势。
混合专家架构通过路由机制激活部分专家提升效率。
- ·行业影响
基准推动AI系统多样性,验证硬件性能与创新技术。
- ›技术细节
MLA和无辅助损失负载均衡成为行业标准。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- MLPerf v6.0结果
- 新基准
- DeepSeek V3 (671B参数)
- GPT-OSS 20B (21B参数)
- 技术趋势
- MoE架构普及
- 稀疏计算主导
- 行业影响
- 推动系统多样性
- 验证硬件创新
金句 / Highlights
值得收藏与分享的关键句。
MoE架构通过智能路由发送不同令牌至专家子网络,仅激活部分参数降低计算成本。
DeepSeek V3是首个6710亿参数的生产级稀疏计算基准,验证MLA和负载均衡技术。
GPT-OSS 20B允许在单8-GPU节点评估复杂路由逻辑,降低硬件门槛。
MLPerf Training v6.0 结果:新的 MoE 基准和记录系统多样性 | MLCommons
MLCommons 发布 MLPerf Training v6.0 结果
新基准和提交内容的多样性反映了人工智能生态系统的重要变化
2026年6月16日
今天,MLCommons ® 宣布了 MLPerf ® Training v6.0 基准套件的新结果。本轮新增的两个基准和收到的提交内容,凸显了人工智能生态系统正在发生的快速而显著的变化。
“这对社区来说是一个激动人心的时刻,”MLPerf Training 工作组联合主席 Shriya Rishab 表示。“我们看到在训练人工智能模型的最佳实践上出现了强烈的共识,但同时,用于托管和运行这些模型的基础框架和系统的技术多样性也在不断增加。”
MLPerf Training v6.0 新增两个基准,强调稀疏计算
MLPerf Training 基准套件包含针对多种机器学习(ML)应用的完整系统测试,对模型、软件和硬件进行压力测试。这个开源且经过同行评审的基准套件为竞争提供了公平的平台,推动了整个行业在创新、性能和能效方面的进步。该套件的基准集合由人工智能社区的专家小组精心策划。
6.0 版本新增了两个基准:DeepSeek V3 和 GPT-OSS 20B,两者都突显了行业向稀疏计算的转变,这种转变以专家混合(MoE)架构为代表。专家混合架构是一种使用智能“路由器”将不同标记发送到专门子网络(“专家”)的模型架构。这使得可以使用一个参数量非常大的模型,因为训练和推理时仅激活一小部分专家,从而降低了计算成本。
DeepSeek V3 是一个大规模预训练模型,采用专家混合(MoE)架构。它总共有 6710 亿个参数,其中每个标记激活 370 亿个参数。它为评估生产规模下领先的开源权重 MoE 模型的训练效率提供了标准化平台。
GPT-OSS 20B 同样是一个 MoE 模型,但其规模小得多:总共有 210 亿个参数,其中每个标记激活 36 亿个参数。这使得组织可以在单个 8-GPU 节点等小型硬件配置上评估 MoE 架构中常见的复杂路由逻辑和稀疏计算模式。
“稀疏计算目前是人工智能领域的主导趋势,”Rishab 表示。“在过去的两年里,所有主要的新一代生成式人工智能模型都采用了稀疏计算架构,通常是 MoE。我们推出了新的 DeepSeek V3 基准来测试大规模稀疏计算训练系统,事实上,它现在是我们套件中参数最多的基准,拥有 6710 亿个参数。它还测试了现在已成为行业标准的关键创新性能,包括多头潜在注意力(MLA)和无辅助损失的负载均衡。”
“在光谱的另一端,我们推出了GPT-OSS 20B基准测试,为那些可能没有资源训练最大规模模型但希望构建先进能力的组织提供了一个入口。我们为这一场景精心设计了该基准测试,包括从随机权重开始训练以避免多千兆字节检查点下载的开销;使用与套件中现有基准(如Llama 3.1 8B)相同的训练数据集;并选择端到端训练中具有代表性的部分以降低生成基准结果的成本,同时不牺牲基准质量。
这两个新基准测试迅速获得采用,吸引了大量结果。利益相关者显然认识到MoE架构性能基准的重要性。”
提交系统的多样性增加凸显了AI训练的新路径
版本6.0在提交系统多样性方面创下新纪录。本轮基准测试参与者提交了95个独特的系统,使用了13种不同的硬件加速器、19种不同的主机处理器以及几种不同的软件框架。60%的系统为多节点架构。
值得注意的是,与六个月前版本5.1的结果相比,提交的云系统数量超过两倍,反映了云上AI训练托管市场的新兴趋势。
“现在获取AI训练的方式比以往任何时候都更多样化,”MLPerf工作组联合主席Pavan Yalamanchili表示。“目前多家公司提供云训练系统,与持续快速扩展的本地系统形成互补。我们很高兴看到如此多来自各种本地和云提供商的竞争性提交。”
同时,这些提交也体现了技术多样性的增长,反映了强大且快速发展的生态系统。例如,提交者使用了多种不同的FP4精度配方,反映了行业当前的多样化探索。
“我们在提交中看到的FP4实现多样性并不令人意外,”Yalamanchili表示。“一些实现比其他实现更灵活,使它们能够用于独特的训练场景。但这也是MLPerf基准测试提供关键洞察和价值的地方:它使利益相关者能够了解哪些实现能为他们的特定需求提供最佳性能。特别是,由于MLPerf基准测试要求提交必须满足准确性阈值,我们突出了这些硬件和实现设计选择可能导致的性能差异。”
行业参与记录的创新高表明,生成式AI推动了广泛的生态系统发展
MLPerf训练v6.0轮次包含来自24家提交组织的性能结果:AMD、ASUSTeK、Azure、Cisco、CoreWeave、Dell、Fujitsu、GigaComputing、Google、HPE、Inventec、Krai、Lambda、MITAC、Nebius、Netweb Technologies India LTD、NVIDIA、Oracle、Quanta Cloud Technologies、SCITIX、Supermicro、tinycorp、TTA和Vultr。“我们特别欢迎首次参与MLPerf训练的提交者:Inventec、Netweb Technologies India LTD、TTA和Vultr,”MLCommons的MLPerf负责人David Kanter表示。
MLPerf Training 的广泛参与有助于增强整个 AI 生态系统,并确保基准测试能够满足社区需求。我们诚邀提交者及其他利益相关方加入 MLPerf Training 工作组,共同推动基准测试的持续发展。
查看结果
请访问 Training 基准测试页面,查看 MLPerf Training v6.0 的完整结果并获取更多基准信息。如需了解每个提交方的具体结果,请阅读补充材料。
关于 ML Commons
MLCommons 是全球领先的 AI 基准测试组织。作为拥有 125 多个成员和附属机构的开放工程联盟,MLCommons 始终致力于汇聚学术界、产业界和民间社会力量,共同衡量并改进人工智能技术。MLCommons 的起源可以追溯到 2018 年的 MLPerf 基准测试,该基准迅速发展为衡量机器学习性能并促进机器学习技术透明度的行业标准指标。此后,MLCommons 一直通过集体工程力量构建更完善的 AI 基准和指标体系,最终目标是帮助评估和提升人工智能技术的准确性、安全性、速度和效率。
如需了解更多关于 MLCommons 的信息或申请成为会员,请访问 MLCommons.org 或发送邮件至 [email protected]。
媒体联络:请联系 [email protected]
分类
MLPerf Training
新闻
作者
ML Commons
分享
- 邮件分享
- 分享至 Facebook
- 分享至 LinkedIn
- 分享至 X
- 复制链接