CoreWeave

Liquid-Cooled Switching Doubles AI Network Bandwidth Per Rack

8.5内容质量
Liquid-Cooled Switching Doubles AI Network Bandwidth Per Rack

TL;DR · AI 摘要

液冷交换机使AI网络每机架带宽翻倍,CoreWeave部署NVIDIA Spectrum-X SN6600-LD实现1.64 Pb/s交换能力。

核心要点

  • 液冷技术使交换机带宽达102.4 Tb/s,每机架交换容量提升至1.64 Pb/s
  • NVIDIA Spectrum-X SN6600-LD是首个全液冷102.4 Tb/s以太网交换机
  • 液冷网络降低GPU空闲时间至接近零,提升大规模训练模型FLOPS利用率

结构提纲

按章节快速跳转。

  1. 现代AI云基础设施中网络成为决定GPU计算效率的关键因素。

  2. 液冷技术使交换机带宽翻倍,实现紧凑型高密度部署。

  3. CoreWeave部署案例

    CoreWeave部署NVIDIA Spectrum-X SN6600-LD交换机,每机架达1.64 Pb/s交换能力。

  4. 1.64 Pb/s交换能力相当于每秒传输国会图书馆藏书160次。

  5. 降低网络延迟提升GPU利用率,推理任务实现低延迟响应。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 液冷交换机提升AI网络带宽
    • 技术优势
      • 102.4 Tb/s交换容量
      • 2U紧凑型设计
    • 部署案例
      • CoreWeave部署NVIDIA Spectrum-X SN6600-LD
      • 每机架1.64 Pb/s交换能力
    • 性能指标
      • 160倍国会图书馆藏书传输速度
      • 零GPU空闲时间

金句 / Highlights

值得收藏与分享的关键句。

#液冷技术#AI网络#NVIDIA#CoreWeave#数据中心
打开原文

CoreWeave 为 AI 网络引入液冷交换技术 | CoreWeave 博客

发布于

2026年7月21日

6

分钟阅读

液冷交换技术使每机架 AI 网络带宽翻倍

作者

Min Jun

Shiv Patil

$

/$

已复制

在现代 AI 云基础设施中,网络已成为战略组件,决定了 GPU 计算如何有效转化为训练和推理性能的吞吐量。这与传统云基础设施形成了根本性转变,在传统架构中,网络通常被视为管道,仅负责在不同节点间传输数据。随着液冷技术使 NVIDIA Vera Rubin NVL72 等机架级系统能够提供百亿亿次浮点运算的计算能力,网络必须与之同步演进。正如计算领域已采用液冷技术,网络领域也正在采用相同方法,液冷技术使新型交换芯片能够在紧凑的外形尺寸中实现卓越性能。

液冷交换机使网络不再是这些加速器性能表现的限制因素。万亿参数模型、执行多步骤推理和并行操作的智能体系统,以及具有紧密推理-训练循环的强化学习流水线,都依赖于 GPU 之间的高速低延迟通信。液冷交换机可通过更密集的机架配置传输更多带宽,使您能够构建充分利用单个机架及跨多机架内 GPU 和 CPU 资源的网络架构。

在 CoreWeave,我们将网络设计为 AI 云的基础层,确保网络架构永远不会成为瓶颈。随着 Vera Rubin NVL72 的部署,我们成为首批部署 NVIDIA Spectrum-X Ethernet SN6600-LD 的云服务提供商,这是业界首款全液冷 102.4 Tb/s 以太网交换机。

液冷交换实现超凡性能

CoreWeave 将 NVIDIA Spectrum-X SN6600-LD 作为 Vera Rubin NVL72 的交换架构。该设备基于 NVIDIA Spectrum-6 ASIC 构建并采用全液冷设计,通过 200G SerDes 技术在 64 × 1.6 Tb/s 端口上实现 102.4 Tb/s 的交换容量,相比上一代产品在单通道带宽上实现翻倍,同时保持紧凑的 2U 外形尺寸。这种由液冷技术实现的高密度与高性能组合,使每个机架实现前所未有的 1.64 Pb/s 交换容量。

为了说明 1.64 Pb/s 交换容量的规模,该网络每秒可将美国国会图书馆的全部文本集合传输约 160 次,且在满负荷运行时无拥塞。当您持续改进智能体或训练模型时,需要实现完整的双向 GPU 到 GPU 网络带宽。

凭借 SN6600-LD 的高密度和大容量,CoreWeave 提供完全无阻塞的多平面、多链路脊叶架构,可连接 Vera Rubin NVL72 GPU 而无过载。对于运行大规模训练的客户,这直接转化为更高的模型 FLOPS 利用率(MFU),通过降低网络延迟、为每个 GPU 提供完整带宽、将 GPU 空闲时间保持在接近零的水平。对于推理工作负载,它可提供持续低延迟,这意味着更快的响应时间、更高的吞吐量和更好的加速器利用率。

部署在 CoreWeave 数据中心的 NVIDIA Spectrum-X SN6600-LD

液冷统一可编程管理

在《CoreWeave针对NVIDIA Vera Rubin NVL72的创新深度解析》中,我们介绍了Valvey和Racky,它们是CoreWeave Mission Control的一部分,用于管理Vera Rubin的环境参数。Valvey和Racky的管理范围还涵盖NVIDIA Spectrum-6 SPX机架,为Vera Rubin NVL72和SN6600-LD以太网交换机提供统一的监控与控制。

Valvey是我们专有的可编程每机架液体冷却阀组件,用于监控和控制流量、温度、压力及泄漏检测。现在Valvey已扩展至Spectrum-6 SPX交换机机架,使网络设备与Vera Rubin NVL72纳入相同的热管理循环。

Racky作为我们的机架控制管理器,将电源、冷却和环境传感器数据整合到单一界面。它监控机架健康状态,控制阀门和电源功能,并呈现如泄漏检测、流量速率和温度等遥测数据。Racky通过统一的管理层直接连接CoreWeave更广泛的基础设施堆栈,而非独立监控每个机架的子系统。

除了Valvey和Racky,Rack Lifecycle Controller(RLCC)在机架层级自动化部署、运营和AI基础设施的生命周期管理。RLCC不再单独管理设备,而是将整个机架(包括GPU、网络、电源和冷却系统)视为单一可编程资源。RLCC协调固件、配置、健康监控和恢复功能,使高密度AI基础设施的部署变得可重复,同时避免通常伴随的运营复杂性。

对客户而言,运营层面的成果是通过统一的软件定义机架管理域实现简化,该管理域具备单一控制界面、单一可观测性层以及覆盖计算和网络架构的统一容量模型。与风冷系统不同,CoreWeave Mission Control已使单独的电源监控、独立的热管理和独立的事件响应流程所需的管理开销成为历史。

当计算和网络架构在统一的可观测性与容量模型下运行时,整个堆栈的信号可靠性也显著提升。这正是CoreWeave ARIA(集成于Weights & Biases)这样的研究迭代代理能够为研究人员提供更清晰答案的原因。它所分析的遥测数据来自已经统一的基础设施,使我们的整个技术栈成为AI研究人员提升效率和速度的竞争优势。

更密集、更快、更凉爽:新的效率提升

液体冷却使SN6600-LD能够在满负载密度下维持线路速率交换性能,不受热限制。在标准48U机架中,可部署16台SN6600-LD交换机,提供总计1.64 Pb/s的交换容量。在这一规模下,空气冷却与液体冷却交换机的选择不再局限于组件层级,而是演变为基础设施架构决策,这一决策对空间、电力和运营复杂性产生复合影响。在这一拓扑结构中,将基于空气冷却的Spectrum-4架构SN5600/SN5610替换为基于液体冷却的Spectrum-6架构SN6600-LD,可实现三大可衡量的提升:

每机架总交换性能提升100%。SN5600/SN5610在100Gb SerDes上实现每64个800Gb/s端口51.2 Tb/s的交换性能,SN6600-LD在200Gb SerDes上实现每64个1.6Tb/s端口102.4 Tb/s的交换性能,在相同外形尺寸下将性能容量、端口速度和单通道带宽均提升至两倍。

机架占地面积和地板空间减少62.5%。凭借更高的密度和容量,SN6600-LD交换基础设施可将16,000个Vera Rubin GPU的机架占地面积和地板空间减少62.5%。更小占地面积下的更高交换容量意味着每平方英尺可容纳更多GPU,同时在固定数据中心空间内为集群扩展腾出更多空间,从而降低每平方英尺的总成本。

电源效率提升30%。与风冷相比,液冷的效率显著提升,这种效率直接体现在交换层:在16,000个Vera Rubin GPU的场景下,SN6600-LD相比SN5600/SN5610的电源效率提升30%。节省的兆瓦数可降低运营成本、简化操作流程,并为更高密度的GPU部署释放电力资源。

液冷NVIDIA Spectrum-6 SN6600-LD与风冷SN5600在连接16,000个NVIDIA Vera Rubin GPU时的每机架效率对比

这些效率提升意味着CoreWeave通过每单位计算消耗更少的电力、空间和材料,从而将每单位AI计算的碳足迹降低至原来的50%。同时在每机架上实现两倍的交换性能。当GPU集群扩展至数万台规模时,这种效率优势将呈指数级放大,使液冷交换技术在性能和可持续性方面均占据优势。

CoreWeave 实现计算与网络冷却的融合,显著提升效率

在现代数据中心设计中,计算、网络和冷却首次实现融合,形成专为AI规模打造的单一软件定义基础设施层。这种效率提升前所未有,将使在更低的电力和空间需求下实现更高的密度成为可能。

在CoreWeave,这种融合已经成为现实。从NVIDIA GB200 NVL72和GB300 NVL72系统到Vera Rubin NVL72以及液冷SN6600-LD,我们构建了一个AI云,其中计算、网络和热管理基础设施无缝协同运作。通过Valvey、Racky和机架生命周期控制器端到端管理,所有组件均通过统一的操作模型进行编排,实现整个机架的部署自动化、生命周期管理和热优化。

这种集成方法使我们能够部署更密集的基础设施,更高效地运营,并提供下一代AI工作负载所需的无阻塞、高性能架构。我们不再将冷却、网络和计算视为独立系统,而是将它们设计为统一平台,使客户能够专注于模型训练和推理,而非基础设施管理。

大多数AI云仍将计算、网络和冷却视为三个独立问题,由三个不同团队分别解决。我们构建的系统则是一个整体,因为在机架规模上,这是唯一可行的数学模型。这就是CoreWeave正在构建的AI云。

想要深入了解本文所述技术细节?注册参加《机架规模革命:CoreWeave与NVIDIA如何构建AI下一阶段的基础》。

观看Vera Rubin NVL72与液冷技术的实际应用。观看《CoreWeave如何扩展智能时代》。

了解 NVIDIA 如何阐述向超大规模液冷网络的转型。阅读《为 Vera Rubin 打造,NVIDIA Spectrum-6 登陆超大规模 AI 工厂》。

全面了解机架级 AI 基础设施的发展方向。2026 年 9 月 29 日至 10 月 1 日,欢迎参加 Fully Connected 26 活动。

CoreWeave 为 NVIDIA Vera Rubin NVL72 部署液冷交换技术,相比风冷交换机,每机架实现 1.64 Pb/s 的交换性能,性能提升 100%。

分享本文: /think