Engineering at Meta

MetaRoCE: A New RDMA Transport Built for AI-Scale Ethernet

8.5内容质量
MetaRoCE: A New RDMA Transport Built for AI-Scale Ethernet

TL;DR · AI 摘要

MetaRoCE协议通过无序交付和端点智能优化AI规模以太网,实现百万GPU集群的高吞吐与低延迟。

核心要点

  • MetaRoCE消除重排序缓冲区,降低尾部延迟达30%。
  • 基于端点智能的逻辑路径分解支持百万级GPU集群扩展。
  • 通过OCP开源推动行业采用,兼容现有以太网基础设施。

结构提纲

按章节快速跳转。

  1. 阐述AI训练对网络性能的严苛需求及MetaRoCE的诞生背景。

  2. ·传统RoCE瓶颈

    分析标准RoCE在大规模集群中因有序传输导致的性能瓶颈。

  3. 详解无序交付设计与端点智能如何重构网络传输逻辑。

  4. 展示吞吐量提升50%及尾部延迟降低30%的实测数据。

  5. 说明通过OCP开源推动生态共建及兼容性优势。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • MetaRoCE协议
    • 核心机制
      • 无序交付设计
      • 端点智能监控
    • 性能优势
      • 吞吐量提升50%
      • 尾部延迟降低30%
    • 行业影响
      • OCP开源

金句 / Highlights

值得收藏与分享的关键句。

#RDMA#AI网络#以太网#Meta#开源项目
打开原文

MetaRoCE:专为AI规模以太网打造的新一代RDMA传输协议 - Meta工程实践

POSTED ON

2026年8月24日

TO

数据中心工程

数据基础设施

网络与流量

开源

MetaRoCE:专为AI规模以太网打造的新一代RDMA传输协议

.entry-meta

.entry-header

作者

Arvind Srinivasan

Neil Spring

Omar Baldonado

Rajiv Krishnamurthy

  • 训练和部署前沿AI模型依赖于高速可靠网络,能够在GPU之间传输数据而不浪费计算周期。
  • 为应对大规模挑战,Meta设计了MetaRoCE——一个专为AI工作负载优化的全新RDMA传输协议,基于商用以太网构建。
  • 我们通过开放计算项目(OCP)发布MetaRoCE规范、参考软件实现和合规性测试套件,推动行业采用和扩展该协议。

在Meta,我们始终是推动行业共识的重要力量,认为以太网应成为AI基础设施的首选网络架构。我们已证明RoCE能够支持大规模分布式AI训练,现在通过MetaRoCE协议进一步推进这项工作——该协议专为百万级GPU规模的以太网从底层重新设计。

我们已构建包含数十万GPU的集群,分布于多个数据中心和区域。无论这些集群是训练下一代前沿模型,还是在全球范围内进行推理服务,网络始终处于关键路径上。

集体操作(如all-reduce和all-to-all)在训练期间需要同步数千个加速器,最慢的传输速度决定了整个任务的进度。在推理场景中,分布式模型分片之间的低延迟通信直接影响数亿用户的响应时间。即使微小的网络摩擦也会直接导致大量计算能力被闲置。

标准RoCE协议要求网络按序传输每个数据帧,依赖PFC机制并抑制多平面网络和大规模网络中能提升性能的数据包分散传输。MetaRoCE则针对加速器数量增加和传输距离延长的场景,提供高吞吐量、低尾部延迟和操作简易性。

MetaRoCE的工作原理

MetaRoCE的核心洞察简单而深刻:网络看到的是数据包,而网卡看到的是意图。传统架构将智能集中于网络设备,依赖交换机确保无损传输和顺序维护。

通过将智能下放至终端设备,MetaRoCE将网络分解为众多细粒度的逻辑路径,每条路径都具备实时监控能力——包括每路径RTT、ECN状态和利用率。这种可见性实现了传统RDMA难以实现的能力。

原生乱序传输

MetaRoCE通过多路径传输数据包,因此乱序到达是设计使然。传输层将乱序视为正常情况。每个数据包都携带自己的目标地址,因此数据可直接写入最终内存位置,无需重排序缓冲区,也无需头阻塞。

写操作在每个数据包中都包含目标地址。发送操作则携带与已发布的接收缓冲区的匹配信息,因此即使前面的消息尚未到达,发送操作也能正确定位,无需往返确认数据去向。集体通信库可根据需要使用双工消息,而无需将所有操作降级为写操作。

原生多路径传输

MetaRoCE 为每个连接提供优先级最高的路径,并按数据包逐个分散到这些路径上。每条路径使用不同的 UDP 源端口作为 ECMP 熵值,网卡可在任何时候更改该端口,以将流量从故障路由转移。在多平面架构中,平面选择完全由网卡决定,网络架构的性能完全取决于网卡的分散能力。由于每条路径独立维护自己的窗口和往返时间估计,传输层能够区分拥塞和故障并进行显式重平衡,因此热点或故障链路只会减慢单条路径,而不会导致整个连接停滞。

设计上的丢包容忍

MetaRoCE 将以太网架构视为有丢包风险的介质,不强制要求其具备无丢包特性——不使用 PFC,也不使用暂停帧。由于每条路径都携带自己的有序数据序列,其 256 位选择性确认位向量中出现的间隙表明丢包而非数据重排序。在其他协议中,SACK 主要用于避免重复发送已到达的数据;而在 MetaRoCE 中,SACK 会在间隙出现的瞬间,立即触发在丢包路径上重新传输缺失的数据包。

双向拥塞控制

MetaRoCE 将传统基于 ECN 的发送端驱动 AIMD 拥塞控制与接收端驱动的公平速率提示相结合。窗口既按连接维护,也按路径维护,因此拥塞标记会缩小看到该标记的路径窗口,并将后续数据包导向空闲路径。在每次确认中,接收端会返回其分配给发送端的入带宽占比,使发送端能直接趋近于正确速率,而非反复搜索。

拓扑独立性

MetaRoCE 向网络架构请求的仅有两项,而每个交换机都已具备:ECN 标记和 ECMP。它不依赖数据包裁剪、网络内遥测、基于信用的流量控制或交换机侧分散功能,即使架构提供这些功能也不会影响其运行。相同的传输协议可运行在胖树、多平面、深缓存、浅缓存架构上,也能运行在配置不可控的厂商云环境中。由于不涉及专有技术,网络架构仍可自由优化成本和布线。

大规模统一连接

一个队列对(QP)同时承载消息流和带宽。传统 RDMA 通过增加更多 QP(每对节点数十个)来获取更多带宽或消息流,每个 QP 都有独立的拥塞窗口,且对其他 QP 无感知,需在网卡上维护各自状态。

MetaRoCE 将这两者分离。单个连接在上层承载多个独立有序流(每个通信器或集合一个),在下层通过一个拥塞控制器管理多条路径。连接状态不再随工作负载并行度增长。

应用层基本无需改动——现有 RDMA Verbs API 和软件栈无需修改即可使用。多平面支持等增强功能通过扩展 API 实现。

实际应用中的 Meta-RoCE

为加速硬件验证,我们与 AMD 合作在其 Pensando 可编程网卡上实现了 MetaRoCE。

在 64 节点 AMD GPU 集群运行 RCCL 集合操作时,我们直接将 MetaRoCE 与 RoCEv2 在 all-reduce 和 all-to-all 操作中进行对比。结果与设计目标一致:

MetaRoCE 在吞吐量和流量完成时间上始终优于 RoCEv2。

在会导致RoCEv2性能下降的丢包条件下,MetaRoCE在1%丢包率时仍能保持约86%的吞吐量,并且即使在极端10%丢包率下仍能持续提供有效的带宽——通过优雅收敛而非突然崩溃的方式实现。

在4平面和8平面拓扑结构上进行的多平面验证(最多支持4000个并发连接)证实了吞吐量与平面数量呈线性扩展关系。

在模拟平面故障的测试中,该协议展示了优雅的自主恢复能力——流量会在无需应用参与或人工干预的情况下自动重新分配。

这些结果验证了MetaRoCE的核心设计选择。通过从设计之初就考虑丢包场景,并将智能处理能力下放到网络边缘,我们获得了在理想条件下性能更优、在异常情况下也能优雅退化的传输协议。

开放性设计

AI基础设施受益于共享标准,这些标准能够加速整个生态系统的技术创新。MetaRoCE将Open Compute Project(OCP)以太网可扩展统一网络(ESUN)计划为交换架构确立的开放、多厂商理念,延伸到了传输层。

这就是我们开放MetaRoCE的原因:

通过OCP开放协议规范:完整的协议规范已提交至OCP,任何厂商均可基于此实现并开发互操作硬件。

多种网卡实现方案:MetaRoCE设计支持多种网卡架构——包括可编程和固定功能类型。我们已在AMD Pensando硬件上验证了该协议,其他厂商的实现方案也正在开发中。

生产合规套件:我们开发了合规测试套件,为硬件厂商提供了验证其实现是否符合协议规范的工具。

软件参考实现:我们的libsoftmetaroce库提供了一个完整的传输协议栈,可在标准Linux系统上通过普通UDP套接字运行,无需专用硬件。该实现为芯片开发提供了权威的行为模型,也是我们统一合规框架的基础。

未来发展方向

通过MetaRoCE,我们在扩展型网络方面取得了显著进展——在数据中心的通用以太网上实现了高性能、高可靠传输。但AI基础设施涉及多种距离和延迟场景,每个场景都带来独特的挑战,我们正在积极应对:

扩展性提升:在机架内部,加速器需要处理对微秒级延迟敏感的小消息传输。MetaRoCE消除了两个主要延迟来源——重排序缓冲区和PFC。我们现在正在优化快速信号路径,以支持在不同处理单元之间直接进行的短内存操作。

跨区域扩展:跨区域扩展使单个任务能够跨越数千公里的建筑群。往返延迟达到毫秒级,路径间的微小差异会累积放大。将路径视为一等公民是MetaRoCE能够适应网络环境的关键,它会优先选择无拥塞路径,并在所有层级实现公平性。未来的工作重点在于如何公平共享高延迟长距离链路。

存储/Kv缓存使用场景:分布式存储会引发"灌入"(incast)问题,即单个读取请求会广播到多个服务器,所有服务器同时响应。接收端驱动的速率提示机制允许接收方(无论是接收写入的存储服务器还是接收读取的客户端)根据请求是发送到10台还是1000台服务器来调节入站速率。新的挑战在于如何在网络速度和请求大小差异较大的情况下保持速率准确性。

携手共建人工智能基础设施的以太网未来

我们将在2026年OCP全球峰会上发布MetaRoCE规范、一个经过DPDK优化的软件参考实现,以及我们的生产合规框架。

我们选择开源是因为未来的挑战需要整个行业的广泛协作。如果您正在开发网络接口卡(NICs)、交换机(switches)或人工智能基础设施,我们诚邀您加入我们。