MLPerf Client v2.0 Expands AI PC Benchmarking with Image Generation and Agentic AI
TL;DR · AI 摘要
MLPerf Client v2.0新增图像生成和智能代理AI基准,提升PC端AI性能评估。
核心要点
- 新增图像生成基准采用Flux.2 klein 4B实验模型
- 智能代理AI测试包含软件工程师和数据分析师场景
- LLM推理测试升级至Phi 4 Mini Instruct和Qwen 3 8B
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- MLPerf Client v2.0更新
- 新功能
- 图像生成基准
- 智能代理AI测试
- 工作负载变化
- Phi 4 Mini Instruct升级
- Qwen 3 8B实验模型
- 合作企业
- AMD
- Intel
- NVIDIA
金句 / Highlights
值得收藏与分享的关键句。
图像生成类别采用Flux.2 klein 4B实验模型,提升视觉能力评估
智能代理AI测试包含SWE Agent和Data Analyst Agent场景
LLM推理测试升级至Phi 4 Mini Instruct并引入Qwen 3 8B
MLPerf Client v2.0 扩展AI PC基准测试,新增图像生成和智能代理AI功能 - MLCommons
MLPerf Client v2.0 扩展AI PC基准测试,新增图像生成和智能代理AI功能
随着行业标准测量PC AI性能的演进,用于生成式AI和智能代理工作流的新基准类别与更新的LLM测试同步发布。
2026年8月18日
MLCommons ® 是一个致力于改进机器学习性能和透明度的开放工程联盟,今天宣布发布MLPerf ® Client v2.0,这是其用于评估个人电脑AI性能的行业标准基准的最新版本。
MLPerf Client衡量从笔记本电脑、台式机到工作站等PC本地运行AI工作负载的效率。随着v2.0的发布,该基准现在新增了智能代理AI和图像生成能力,与已有的LLM基准测试(如摘要、内容创作和代码分析等现实任务)相结合,同时报告响应性和吞吐量两项指标。
MLPerf Client v2.0 新增功能
2.0版本引入了一系列新功能、改进和扩展支持,旨在跟上AI硬件和软件快速发展的步伐:
重大工作负载变更
- 新增图像生成类别:新增该类别显著提升了基准的实用性,通过Flux.2 klein 4B实验性测试,可评估生成式视觉能力。
- 新增智能代理AI类别:通过软件工程(SWE)代理和数据分析师代理场景,对智能代理AI性能进行基准测试。报告端到端性能,包括大语言模型推理和工具执行时间的详细分析。
- 更新LLM推理测试:此版本将所需工作负载中的Phi 3.5 mini instruct升级为Phi 4 Mini Instruct,同时引入Qwen 3 8B作为实验性测试。基础任务现在包含一个中级摘要任务,输入提示词约为4K tokens。
这些更新标志着向全面、跨平台的客户端AI计算基准又迈出了重要一步。
MLPerf Client是技术领导者之间的合作成果,包括AMD、Intel、Microsoft、NVIDIA、Qualcomm Technologies, Inc.以及顶级PC原始设备制造商(OEM)。这些参与者为该AI基准的创建贡献了资源和专业知识。
MLPerf Client v2.0 可免费下载,源代码通过MLCommons GitHub仓库开放供检查和社区贡献。要下载、查阅文档或获取更多信息,请访问 mlcommons.org 。
GitHub发布(Windows、macOS、Linux):https://github.com/mlcommons/mlperf_client/releases 关于MLCommons
MLCommons是一个开放工程联盟,致力于让机器学习惠及所有人。该组织生产的行业领先基准、数据集和最佳实践覆盖了从大规模云训练到资源受限边缘设备的整个机器学习应用范围。其MLPerf基准套件已成为评估AI性能的行业标准。
了解更多请访问 www.mlcommons.org 。
媒体联系:[email protected]
分类
MLPerf Client
新闻
作者
ML Commons
分享
- 邮件分享
- Facebook分享
- LinkedIn分享
- X平台分享
- 复制链接