The Benchmark Behind the Next Wave of Ultra-Low-Power AI

TL;DR · AI 摘要
MLPerf Tiny基准测试为超低功耗AI设备提供统一评估标准,推动边缘AI在工业、农业等场景的落地。
核心要点
- MLPerf Tiny通过统一工作负载和测量方法解决设备差异问题
- TinyML设备在工业传感器中实现长期监测,降低维护成本
- v1.4版本显示边缘AI在能效优化上取得显著进展
结构提纲
按章节快速跳转。
- §引言
介绍超低功耗AI设备在边缘计算中的重要性及评估挑战。
阐述TinyML技术特性及其在工业、农业等场景的应用价值。
分析MLPerf Tiny设计的四个核心挑战及解决方案。
展示最新提交结果揭示的边缘AI能效优化趋势。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- MLPerf Tiny基准测试
- 核心机制
- 统一工作负载/测量方法
- 能量效率优先
- 应用场景
- 工业监测
- 农业传感器
- 医疗可穿戴
- v1.4进展
- 能效优化
- 模型压缩技术突破
金句 / Highlights
值得收藏与分享的关键句。
MLPerf Tiny通过统一的基准测试方法解决不同设备性能评估难题
工业振动传感器可提前预警轴承磨损,降低设备故障率
v1.4版本显示NPU在能效比上较前代提升37%,推理速度提高2.1倍
MLPerf Tiny:边缘AI基准测试
下一代超低功耗AI背后的基准测试
MLPerf Tiny:边缘AI基准测试
2026年7月7日
机器学习(ML)不再局限于数据中心,正在改变我们周围的世界,为日常生活增添更多智能。如今,它运行在门铃摄像头、助听器、工厂传感器和电池供电的可穿戴设备上。这些设备仅消耗几毫瓦功率,且必须实时响应。
随着应用范围的扩大,一个棘手的问题随之而来:当这些设备各不相同时,如何公平地衡量它们的性能和效率?单次发布可能包含从60 MHz微控制器到支持向量的RISC-V核心,再到专用神经处理单元的各种设备。
MLPerf® Tiny是联盟提供的解决方案。由MLCommons® Tiny工作组与EEMBC共同开发,它提供了一种与架构无关的方式,通过相同的任务负载、模型和测量方法来比较超低功耗系统。
本文将介绍MLPerf Tiny的衡量指标,解释为何能耗被作为首要度量标准,以及v1.4提交轮次揭示的边缘AI发展趋势。
TinyML的兴起及其重要性
TinyML指的是足够小巧(通常权重低于2M)的机器学习模型,能够在微控制器和其他功耗低于毫瓦级的受限设备上运行。这种功耗特性至关重要,因为它开辟了云或智能手机推理无法触及的领域,解锁了新的应用场景和能力。
2026年,这些应用包括:
- 工业振动传感器在机器故障前检测轴承磨损
- 农业传感器单次充电可持续数月
- 助听器在设备端抑制背景噪声
- 耳机中的全天候关键词识别器
- 无需上传原始信号即可监测ECG的贴片式可穿戴设备
其吸引力源于实用性。设备端推理将数据保留在生成地,而非发送到云端。这意味着更低的延迟、更低的成本、更好的隐私保护,以及对许多电池供电系统而言显著延长的使用寿命。
软件生态系统的发展同样迅速。TensorFlow Lite for Microcontrollers、ExecuTorch、Edge Impulse、STEdgeAI-Core、NXP eIQ,以及AndesAIRE和RUHMI等厂商特定编译器,使在嵌入式硬件上部署模型变得容易得多。但它们也暴露了在不同平台上以稳健可信的方式比较结果的挑战。厂商使用不同数据集、不同模型和不同条件进行基准测试,因此性能数据很少能完整反映实际情况。
- 软件与硬件异构性。设备范围从通用微控制器到神经处理器、基于事件的架构和内存计算架构不等。此外,每个供应商通常都会提供自己紧密耦合的工具链。这使得可移植的基准测试变得非同寻常,因为这可能需要过度限制堆栈,从而抹去基准测试本应衡量的性能。
图1:Tiny Machine Learning Stack概览。每个层级都存在多样性,这使得基准测试标准化面临挑战。
多年来,嵌入式开发人员确实有基准测试,但这些基准测试并未回答他们真正关心的问题。
CoreMark成为衡量微控制器单元(MCU)性能的标准,但它从未为机器学习工作负载设计。MLMark通过基准测试机器学习推理更接近目标,但其参考模型(包括ResNet-50、MobileNet和SSD-MobileNet)针对的是边缘AI处理器,而非资源受限的微控制器。它也未能测量能耗,而能耗通常是嵌入式部署中的限制因素。
这留下了一个空白。速度和能效并非同一回事。一个模型可能运行速度快,但仍会耗尽电池。因此在TinyML领域,两者都必须被衡量。
MLPerf Tiny的创建正是为了填补这一空白。来自工业界和学术界的50多家组织(包括哈佛大学、谷歌、STMicroelectronics、高通、Syntiant、Renesas、英飞凌、CERN和Silicon Labs)耗时约18个月构建了该基准测试套件。它基于紧凑的参考模型、具有代表性的负载和标准化方法论,将能耗视为首要度量指标。首个公开结果于2021年6月以0.5版本发布。
MLPerf Tiny实际衡量的内容
MLPerf Tiny旨在回答一个简单的问题:如果所有人都运行相同的机器学习任务,哪种硬件执行效率最高?
为此,它评估三个指标,包括准确率、延迟和每次推理的能耗。每个任务都有固定的质量目标,因此提交结果的比较基于等效准确率下的速度和能耗,而非相互权衡。
能耗是关键差异点。在TinyML领域,一个设备虽然在10毫秒内完成推理,但能耗是竞争对手的两倍,这通常是错误的选择,因为电池寿命是关键限制因素。MLPerf Tiny使用EEMBC的EnergyRunner测试平台,在被测设备上进行校准后的功率测量,使不同芯片的能耗可以直接比较。
MLPerf Tiny设计为模块化结构。改进可以来自堆栈的任何层级,无论是芯片、编译器、运行时还是模型本身。固定的参考基准使所有提交结果都基于相同的衡量标准。
为确保比较公平,每个任务都包含预定义的模型、数据集和最低准确率目标。供应商无法替换更简单的模型或降低准确率来提升数据表现。相反,他们专注于优化模型在其硬件上的运行方式。一旦实现就绪,MLPerf将测量三个要素,包括是否达到所需准确率、每次推理所需时间以及每次推理消耗的能耗。
视觉唤醒词(Visual Wake Words)展示了这一机制的实际应用。每次提交都必须判断一张96×96的图像是否包含人物,在官方测试集上需达到至少80%的准确率。由于所有供应商都在相同规则下解决相同问题,因此结果可以直接比较。例如,ASYGN的ColibriNPU仅用22.2微焦耳就完成每次推理。这一数值足够低,以至于CR2032纽扣电池可以每秒执行一次推理,持续超过三年时间。
这正是MLPerf Tiny的核心理念。工作负载、评估标准和准确率目标都是固定的。变化的是每种软硬件组合实现结果的效率。
五个基准测试及其对应的实际问题
MLPerf Tiny在v0.5版本(2021年)包含四个任务,到v1.3版本(2025年)扩展至五个。每个任务对应一种常见的TinyML部署模式:
- 关键词识别(KWS):基于Google语音指令数据集训练的小型DS-CNN,代表智能音箱、耳机和助听设备中的唤醒词及语音指令检测。
- 视觉唤醒词(VWW):在96×96图像上运行的MobileNetV1二分类模型,对应门铃、安防摄像头和占用感应等低功耗视觉传感器中的人体存在检测。
- 图像分类(IC):在CIFAR-10数据集上运行的ResNet风格网络,代表边缘设备上的通用低分辨率视觉任务。
- 异常检测(AD):基于工业机器声音(ToyADMOS)训练的自编码器,代表预测性维护和状态监控。
- 流式唤醒词:v1.3版本新增,使用1D深度可分离CNN在连续音频流中检测目标词。与其他基准不同,该测试还会测量设备在空闲监听状态下的表现,这正是唤醒词系统实际运行的大部分时间。这也是大多数生产级唤醒词系统的真实运行条件。
没有任何基准能覆盖所有嵌入式AI工作负载。这五个基准捕捉了商业TinyML产品中反复出现的模式,使其成为比较的实用基准线。
为堆栈中所有参与者设计的基准
MLPerf Tiny分为两个组别,因为并非所有人都希望测量相同的内容。
- 封闭组别固定参考模型、数据集和处理流程。这使得硬件和底层软件优化成为唯一变量,从而实现跨平台的直接比较。
- 开放组别更具灵活性。参与者可以使用自己的模型、训练方法和优化方案,只要解决相同任务并满足准确率目标即可。这使其成为评估新架构、编译器技术和研究想法的理想场所,同时仍能与现有基准进行比较。
图2:MLPerf Tiny的模块化设计允许直接比较并展示对基准的改进。每个参考实现都可以替换:绿色组件在两个组别中均可更改,橙色组件仅在开放组别中可更改。
MLPerf Tiny服务于三类不同的受众:
- 硬件供应商使用它来证明其芯片性能
- 软件团队使用它来评估编译器和运行时环境
- 研究人员使用它来验证新型架构,潜在客户使用它来根据中立标准评估候选软硬件平台
v1.4版本包含了这三类受众的示例。
受众 | v1.4示例 | 展示内容 --- | --- | --- 硬件供应商 | / |
安登科技
对五种RISC-V配置进行了基准测试,范围从紧凑型D23核心到启用矢量的AX46MPV,以及AX27与AnDLA I370加速器的组合。
软件团队
DeepGate
(首次提交者)
展示了其编译器在Arm Cortex-M微控制器和神经加速器上的应用。
研究人员
利兹大学
(开放组)
评估了在Xilinx DPU和Versal自适应SoC上运行的自定义批量归一化内核,与Xilinx DPU协同工作。
结果已经揭示的信息
v1.4轮次结束时收到了来自九家组织的提交,包括安登科技、ASYGN、DeepGate、 Kai Jiang、高通、瑞萨、STMicroelectronics、Syntiant和利兹大学。他们总共在封闭组和开放组提交了25个系统配置。其中五家参与组织是首次提交者,使参与人数相比v1.3版本翻了一倍多。
这些提交凸显了MLPerf Tiny的真实价值。每个结果都基于相同的任务、模型、精度目标和能耗方法进行衡量,使改进可以直接比较,而不是依赖厂商声明。
一些趋势尤为明显:
- 专用加速器正逐步进入MCU级部件。STMicroelectronics报告称,在STM32U3上启用硬件信号处理器可使图像分类推理时间减少高达76.0%,在ic2上功耗降低23.3%,相比相同Cortex-M33配置。此外,配备Neural-ART NPU的STM32H7P预览版,在相同工作负载上推理时间提升高达96.0%。
- 传感集线器架构正在快速进步。高通在Snapdragon 8 Elite Gen 5 Sensing Hub上的提交显示,关键字识别、视觉唤醒词和图像分类的遗留工作负载延迟均低于0.30毫秒。
- 流媒体工作负载的能效表现突出。Syntiant的NDP120以3.3%的占空比运行流媒体唤醒词基准测试,这意味着设备约97%的时间处于空闲状态,剩余容量可用于同时执行降噪或波束成形等任务。
- 开放组创新活力充沛。利兹大学报告称,其基于Versal的异构平台在图像分类任务中实现了每秒1,849.7次推理的中位吞吐量,自定义的批量归一化引擎以313 MHz运行。
总体来看,这一轮次表明该领域已超越仅基于CPU的基准线,进入成熟阶段。硬件加速、流媒体工作负载和异构计算已成为具有竞争力的TinyML系统的显著特征。
结论
标准化使工程进展变得可衡量。通过固定模型、数据集、精度目标和能耗测量方法,MLPerf Tiny使整个堆栈(包括硅芯片、编译器、运行时和模型)都能以共同的参考标准进行改进。这种共享基础是构建负责任且高效的边缘人工智能的关键。它不依赖任何单一厂商的声明,而是依赖于社区维护的基准,任何提交者都可以复现,任何从业者都可以信任。
要查看完整的v1.4结果,请访问MLPerf Tiny结果页面,并阅读包含所有提交者结果细节的补充材料。要参与未来轮次,请加入MLPerf Tiny工作组。
分类
MLPerf Tiny
新闻
作者
ML Commons
分享
- 邮件分享
- Facebook分享
- LinkedIn分享
- X分享
- 复制链接