What Comes Next: Operating and Evolving the Production AI Factory

TL;DR · AI 摘要
AI工厂运营的核心是优化goodput指标,CoreWeave在NVIDIA Hopper GPU上实现96%的goodput,揭示吞吐量与弹性对AI系统效率的决定性影响。
核心要点
- CoreWeave在NVIDIA Hopper GPU上实现最高96%的goodput,显著提升AI训练效率
- goodput由吞吐量(MFU)和弹性(MTTF)决定,Hopper系统MFU比其他基准高20%
- 长期分布式训练中,系统中断恢复时间直接影响生产环境的经济性
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI工厂运营与优化
- 核心指标
- goodput(有效吞吐量)
- 影响因素
- 吞吐量(MFU)
- NVIDIA Hopper提升20%
- 弹性(MTTF)
- 提升10倍
- 技术验证
- CoreWeave基准测试
金句 / Highlights
值得收藏与分享的关键句。
CoreWeave在NVIDIA Hopper GPU上实现最高96%的goodput,显著提升AI训练效率
goodput由吞吐量(MFU)和弹性(MTTF)决定,Hopper系统的MFU比其他基准高20%
长期分布式训练中,系统中断恢复时间直接影响生产环境的经济性,需优先优化弹性
NVIDIA、CoreWeave 与规模化 AI 工厂运营
发布于
2026 年 8 月 12 日
8
分钟阅读
下一步:生产 AI 工厂的运营与演进
作者
Shadi Saba
Dion Harris
已复制
这是 CoreWeave 与 NVIDIA 联合发布的关于生产 AI 工厂生命周期系列文章的第二篇。在第一部分《为什么 AI 工厂需要投产前验证》中,我们探讨了如何通过协同设计和验证为部署做好集成堆栈的准备。本文将讨论接下来的内容:规模化运营以及为下一代加速计算做好准备。
设计和验证堆栈的相同严谨性会延续到工作负载上线后,持续捕捉健康信号、保持调度稳定、在需要之前就准备好恢复方案。这正是该严谨性接受考验的起点,从系统从验证状态转向运营状态后的变化开始。
此时关注的不再是系统是否能工作,而是能否持续稳定运行,以模拟生产环境的两周连续运行测试。即使集群通过所有基准测试,仍可能因中断损失实际运行时间,或检查点未能静默保存。此时真正重要的不是硬件速度,而是有多少速度转化为实际产出,而非恢复时间。
规模化运营
第二天的运营始于第一天的结束
第二天运营的核心实质是在问题导致运行中断之前就发现并解决。这包括持续的健康信号监控、工作负载可见性、调度控制,以及在出现故障时的快速响应。长时间运行的分布式训练任务不会给延迟一天发现中断的机会。
良好产出率决定 AI 工厂经济性
在这些系统运行的规模下,一个指标决定了经济性。客户支付的计算资源中有多少转化为工作负载进展,这就是良好产出率(goodput),即系统用于有效工作的时间占比,而非用于恢复中断的时间。在长时间运行的分布式训练任务中,CoreWeave 在 NVIDIA Hopper GPU 上实现了高达 96% 的良好产出率,这始终是上限而非保证。低于该线的所有情况都属于生产力损失,是系统未能交付的有用工作,因为资源被用于中断处理和恢复,而非模型进展。
决定良好产出率的关键变量
决定该指标的两个关键变量是吞吐量和弹性,而一个包含 1,024 台 NVIDIA Hopper GPU 的集群基准测试可以分别衡量这两个变量。
吞吐量。模型 FLOPs 利用率(MFU)衡量 GPU 峰值吞吐量实际转化为模型进展的比例。CoreWeave 在基于 Hopper 的系统上测得的 MFU 比其他公开报告的基准高出 20%。MFU 只能讲述部分故事。决定训练运行完成速度的是有效吞吐量,即该利用率乘以 GPU 的峰值能力。MFU 还取决于工作负载,会随着模型架构(密集型与专家混合型)、序列长度和并行度而变化,因此该数据反映的是测试环境下的表现,而非普遍结果。
弹性。平均故障时间提升了约10倍,有效训练时间占比最高可达98%。重启和检查点丢失导致的中断减少到这种程度时,时间线将不再被中断影响。在CoreWeave Cloud上,这些提升来自于两个层面的协同作用:GPU、CPU和机架架构中内置的可靠性、可用性和可维护性(RAS),以及CoreWeave的软件层,该软件层能够检测、隔离并从问题中恢复。这些提升来自于更少的中断和更快的恢复;故障仍然会发生,但它们消耗的时间更少。在NVIDIA方面,每一代产品都会提升弹性。NVIDIA Blackwell引入了专用的RAS引擎,该引擎通过人工智能预测性维护,覆盖数千个硬件和软件数据点。从硅芯片开始构建的可靠性,并与机架级系统的拓扑感知调度协同作用,这种集成堆栈通过持续运行有用工作,而不是事后添加,从而保持了工作流的连续性。NVIDIA Vera Rubin进一步通过第二代RAS引擎实现主动维护和实时健康检查,无需停机。硅芯片可以标记性能下降的组件,但需要上层系统决定如何处理。在系统层面,模块化无缆线托盘使Vera Rubin的组装速度比Blackwell快90倍,并简化了可维护性,而软件定义的NVLink路由则绕过故障点,保持操作连续性并减少维护开销。
统一的软件与硅芯片如何提升AI工厂可靠性
这一决策层是CoreWeave任务控制(CoreWeave Mission Control),它为运行这些集群的团队提供可靠性、透明度和可操作的洞察。它的职责是在故障影响客户运行之前,通过拖尾检测、自动节点排水、舰队和机架生命周期管理以及恢复工作流程来捕获并隔离基础设施故障。要做到这一点,需要每秒处理所有客户环境中的2亿多个指标样本,因为必须先观察到延迟,才能进行排水处理。SUNK(CoreWeave提供的Kubernetes上的Slurm解决方案)动态地在相同集群的训练和推理工作负载之间重新分配GPU,当需求变化时,释放的容量会立即重新投入工作,如我们在NVIDIA Vera Rubin NVL72深度解析中所述,而不是在任务之间闲置。这些能力支撑了CoreWeave在NVIDIA GB300 NVL72上的MLPerf Training v6.0测试结果,其中任务控制保持了稳定的性能基准,而SUNK的NVIDIA NVLink域感知放置则在NVL72域内保持了通信的本地化。
这种信心建立在两家公司之上,而非一家。每当NVIDIA推出新一代产品时,这种信心都会接受考验。每一代产品都能释放出更高的效率和更强的性能。推理和专家混合模型正在将部署规模推向前所未有的高度,而计算、网络和运营需求也随之攀升。通过紧密协作,NVIDIA与CoreWeave通过优化堆栈的每一层来应对这些创新。不变的是生命周期管理流程:共同设计、部署前验证、上线后实现全可视性运营。
为NVIDIA Vera Rubin NVL72做好准备
2026年6月,CoreWeave完成了行业首个NVIDIA Vera Rubin NVL72的启动和验证。相同的准备纪律,新一代平台。客户继承的是经过验证的系统,而非成为生产环境中调试新架构的先行者。
NVIDIA通常每代产品会重新设计1-2款芯片,但Vera Rubin平台为满足AI需求,每代都会重新设计所有芯片。六款专为AI设计的芯片被整合为一台超级计算机:Vera CPU、Rubin GPU、NVLink 6交换机、ConnectX-9 SuperNIC、BlueField-4 DPU和Spectrum-6以太网交换机(与ConnectX-9结合,带来下一代NVIDIA Spectrum-X以太网平台)。通过整合规模扩展和分布式网络、执行效率、安全性和弹性的突破性进展,Vera Rubin平台解决了核心通信、内存和计算瓶颈,在实现大规模智能的同时,降低了训练、训练后处理、推理和智能代理推理的成本。
这种弹性是代际跃迁最显著的体现。Rubin GPU配备了专用的第二代RAS引擎,可实现无停机的主动维护和实时健康检查,而Vera CPU则增加了SOCAMM LPDDR5X可维护性以及系统内核心测试功能。在系统层面,模块化无缆线托盘使组装速度比Blackwell快达90倍,并简化了维护流程,软件定义的NVLink路由可绕过故障点持续运行,减少维护开销。
其下支撑的运营层
六款芯片整合为一台超级计算机仍需逐架机柜进行管理,特别是在100%液冷且无风冷选项的高功率密度场景下。CoreWeave为此专门构建了三套系统。Valvey和Racky是CoreWeave的专利创新,专为Vera Rubin设计,仅在CoreWeave平台可用。
Valvey是每架机柜的液冷阀门组件,将冷却从被动机械系统转变为软件定义的控制界面,持续监控流量、温度和压力,并在出现异常时自动隔离机柜,而不会影响相邻机柜。Rack LifeCycle Controller协调所有流程的运行。Racky是每架机柜的控制节点,将两者连接在一起,将电源、冷却和环境传感器聚合到统一的标准界面上,使机柜像其他云资源一样被管理,而非定制的单次构建。了解更多关于Valvey和Racky的信息请访问此处。
规划下一代AI工厂
CoreWeave与NVIDIA合作,计划利用NVIDIA DSX平台的参考设计打造下一代AI工厂。DSX MaxLPS在GPU、机架和工作负载层级上应用智能优化,并在固定功耗预算内动态执行功耗策略。DSX Flex则跨电网、现场可再生能源和存储系统协调功耗,在实时电网信号(如负荷削减、需求响应和定价事件)下动态调整工作负载。CoreWeave使用NVIDIA DSX Air构建其AI工厂和数据中心的高保真数字仿真,在硬件物理部署前进行验证。
生命周期,而非发布
部署一个生产级AI工厂不仅仅是交接。这是一个包含规划、测试、验证和学习的完整生命周期。对CoreWeave而言,容量只是起点,而非终点。NVIDIA提供AI工厂平台,CoreWeave则提供原生AI云软件和运营层,双方共同验证客户将运行的集成堆栈。
AI工厂需要整个合作伙伴生态系统进行极端协同设计。网络、存储和软件作为一个统一系统协同工作,以释放领先的性能。
简单来说,多年来深入这些系统的经验表明:困难的部分从未是芯片本身。真正挑战在于网络、存储、调度器和恢复路径在运行过程中实时协同运作,以及日复一日维持这种协同运作的运营能力。这就是为什么生命周期,而非发布,决定了工厂是否能成功交付。
准备深入了解更多?
错过了本系列博客的第一部分?请阅读《为何AI工厂需要投产前的验证》。了解NVIDIA和CoreWeave如何联合设计并优化集成技术堆栈,并在客户部署前进行验证。
探索CoreWeave上的NVIDIA Vera Rubin,了解目前最先进的机架级AI计算系统,该系统专为智能体AI和推理时代而构建。
阅读CoreWeave创新深度解析,了解CoreWeave作为首家成功部署并验证NVIDIA Vera Rubin NVL72的云服务提供商背后的真实故事。
生产AI工厂生命周期系列,第二部分:CoreWeave如何在大规模场景下运营堆栈,从吞吐量到可靠性,并推进至NVIDIA Vera Rubin NVL72就绪状态。
分享本文: /share