MLCommons

MLCommons Releases New MLPerf Storage v3.0 Benchmark Results

8.5内容质量

TL;DR · AI 摘要

MLPerf Storage v3.0新增KV Cache和Vector Database测试,并支持S3访问层,提升AI存储性能评估。

核心要点

  • v3.0新增KV Cache测试,用于评估LLM推理缓存性能
  • Vector Database测试支持高维数据存储性能评估
  • 约16%的提交使用S3存储访问层进行测试

结构提纲

按章节快速跳转。

  1. 宣布MLPerf Storage v3.0基准测试结果,扩展存储性能评估范围

  2. 介绍KV CacheVector Database两种新测试类型及其应用场景

  3. 测量LLM推理中键值缓存的读写性能,优化迭代式AI应用

  4. 评估向量数据库在高维数据存储和查询中的表现

  5. ·S3支持扩展

    新增S3对象存储访问层,支持训练/检查点/部分VDB测试

  6. 帮助AI系统设计者选择存储技术,减少性能瓶颈

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • MLPerf Storage v3.0
    • 新增测试
      • KV Cache测试(LLM推理缓存)
      • Vector Database测试(高维数据)
    • S3支持
      • 训练/检查点/部分VDB测试支持
      • 16%提交使用S3访问层
    • 行业影响
      • 优化AI系统存储性能瓶颈
      • 支持多样化存储技术选型

金句 / Highlights

值得收藏与分享的关键句。

#MLPerf#存储基准#AI系统#S3
打开原文

MLCommons 发布 MLPerf Storage v3.0 基准测试新结果 - MLCommons

MLCommons 发布 MLPerf Storage v3.0 基准测试新结果

基准套件现已覆盖存储系统全范围的 AI 工作负载

2026年9月1日

今天,MLCommons® 宣布发布其行业标准 MLPerf® Storage v3.0 基准测试套件的测试结果,该套件以中立架构、代表性强且可复现的方式衡量存储系统在机器学习(ML)工作负载中的性能。v3.0 版本扩展了测试范围,以涵盖 AI 系统可能生成的各类存储工作负载,并新增对 S3 对象存储访问层的支持,与现有的 POSIX 层并行使用。

两项新的基准测试

v3.0 版本新增了 KV Cache 测试,用于衡量大语言模型(LLM)推理缓存读写操作的存储性能。键值缓存是一种广泛采用的技术,可提升基于转换器的 AI 推理应用性能,尤其适用于需要反复访问相同键值向量的自回归模型(如 LLM)。

该版本还新增了向量数据库(VDB)测试,用于衡量向量索引和查询工作负载的存储性能。向量数据库用于存储超出传统数据库架构极限的高维数据,AI 应用常利用其存储文本和媒体等非结构化数据。

“这些新增测试完善了基准套件的测试集合,覆盖了驱动存储需求的更广泛 AI 推理工作负载,”MLPerf Storage 工作组联合主席 Brian Belgodere 表示。“在训练方面,我们已有训练和检查点测试;在推理方面,现在新增了 KV 缓存和向量数据库测试。通过增加分解单体 AI 系统并聚焦特定存储使用场景的测试(如检查点、KV 缓存和向量数据库),利益相关方可以更清晰地了解如何设计和配置 AI 系统以减少存储性能瓶颈。”

新增 S3 对象存储访问层

此外,v3.0 版本新增了对 S3 对象存储访问层的支持,作为现有 POSIX 兼容层的补充和替代方案。在 v3.0 版本中引入此功能,使相同工作负载下能跨更广泛的托管存储选项进行性能对比。S3 层在 v3.0 基准测试套件的训练、检查点以及部分 VDB 测试中得到支持。本轮提交中约六分之一的总提交量使用了 S3 存储访问层。

“在 MLPerf Storage 基准测试套件中进一步扩大对包括 S3 在内的多样化存储系统的支持,使为 AI 系统配置资源的组织能够更灵活地选择和组合技术以满足其应用的特定技术需求,”MLPerf Storage 工作组联合主席 Curtis Anderson 表示。“随着 AI 应用场景规模达到万亿级别,我们预计基于对象的存储系统将作为文件系统存储的可行甚至更优替代方案出现。通过现在启用 S3 支持,我们确保利益相关方能够获得做出明智决策所需的性能信息。”

十九家组织参与了本轮基准测试。“我们特别欢迎首次提交的十一家组织:Azure、Everpure、HolmesAI、Nebius、NewFW、NVIDIA、OpenLake、苏州紫山隆霖、TuringData、XSKY 和 ZettaLane,”MLPerf 负责人 David Kanter 表示。“存储社区广泛接纳了 MLPerf Storage 基准测试,提交方既包括基于云和本地的解决方案提供商,也包括开发存储系统和设备的组织。这种广泛的参与表明,MLPerf Storage 基准测试为涉及人工智能系统部署各个方面利益相关者提供了关键信息。”

性能结果提供了关于存储行业现状的独特且重要的见解,包括能效表现。本地部署的检查点写入测试提交结果中位数达到每瓦14GB/秒,最高值达到201。同样,UNet3D读取测试提交结果中位数达到每瓦34GB/秒,最高值达到277。“结果中体现了广泛的能效范围,”Anderson 表示,“这对为人工智能应用采购存储解决方案的利益相关者来说是关键的性能信息。这也表明仍有大量改进空间,我们鼓励所有供应商优化这一指标。”

MLPerf Storage 基准测试由35家领先的存储解决方案提供商和学术研究机构通过为期五年的协作工程流程共同创建。这套开源且经过同行评审的基准测试套件为竞争提供了公平的平台,推动了整个行业在创新、性能和能效方面的进步。它还为采购和调优人工智能训练及推理系统的客户提供关键技术信息。

我们邀请利益相关者加入 MLPerf Storage 工作组,帮助我们继续完善基准测试套件。

查看结果

要查看 MLPerf Storage v3.0 的结果,请访问 存储基准测试结果 页面。如需了解结果的更多信息,请访问 补充讨论 页面。

关于 MLCommons

MLCommons 是全球人工智能基准测试领域的领导者。作为由125多个成员和附属机构支持的开放工程联盟,MLCommons 一直致力于将学术界、工业界和民间社会汇聚在一起,以衡量和改进人工智能技术。MLCommons 的基础始于2018年的 MLPerf 基准测试,该基准测试迅速发展成为衡量机器学习性能和促进机器学习技术透明度的一系列行业指标。此后,MLCommons 继续通过集体工程构建用于改进人工智能的基准测试和指标,最终帮助评估和提升人工智能技术的准确性、安全性、速度和效率。

如需了解更多关于 MLCommons 的信息或了解如何成为会员,请访问 MLCommons.org 或发送电子邮件至 [email protected] 。

分类

MLPerf Storage

新闻

作者

ML Commons

分享

  • 邮件分享
  • Facebook 分享
  • LinkedIn 分享
  • X 分享
  • 复制链接