Why AI Factories Need Proof Before Production

TL;DR · AI 摘要
AI工厂需在生产前验证基础设施可靠性,NVIDIA与CoreWeave合作提升AI计算效率。
核心要点
- AI工厂需验证全栈系统连续运行能力,避免GPU资源浪费和项目延误
- NVIDIA DSX平台与CoreWeave合作实现AI工厂效率提升10倍
- Vera Rubin NVL72在DeepSeek R1任务中能耗效率达GB200 NVL72的10倍
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI工厂生产验证
- 验证必要性
- 持续高负载需求
- 资源浪费风险
- NVIDIA-CoreWeave合作
- DSX平台整合
- Vera Rubin部署
- 性能基准
- 10倍能耗效率提升
金句 / Highlights
值得收藏与分享的关键句。
Vera Rubin NVL72生成10x tokens-per-second per megawatt相比GB200 NVL72
未验证的基础设施可能导致GPU资源闲置和项目进度延迟
NVIDIA DSX平台定义AI工厂建设的参考架构标准
为生产AI协同设计的AI工厂 | CoreWeave博客
发布于
2026年7月29日
阅读时间
为何AI工厂在投产前需要验证
作者
Shadi Saba
Dion Harris
已复制
长期以来,拥有GPU就意味着准备就绪。架设机架、供电、制冷,仪表盘变绿就是全部的测试。
现在情况不同了。真实的AI工作负载不会询问计算资源是否存在,而是会检验计算、网络、存储、调度和恢复能否连续两周稳定运行,不会在任何环节出现卡顿。AI工厂通过保持堆栈各层的同步协作,将电力转化为令牌,将训练运行时间从数天缩短至数小时,并加速令牌吞吐量。
标准持续提升
支持服务清单只会不断扩展。可观测性、健康管理和运维工作需要在后台任务运行时协同配合。越来越多的新任务实际上永远不会结束。由于智能体工作负载的特性,终端用户不希望等待结果。随着智能体AI需求的增长,令牌吞吐量也在增加。AI云不能为了速度牺牲可靠性。智能体调用工具或运行多步骤推理循环可能在任何时刻激增需求,因此团队必须准备基础设施来应对波动需求。
实现生产级AI
这在实践中具体表现为:停滞的任务会限制GPU资源并延迟项目进度。丢失的检查点意味着必须重复已经完成的工作,使用同样宝贵的硬件。未充分利用的资源无论是否生成令牌都会产生费用。在这样的高速环境中,团队无法承担生产力损失或计算资源利用率不足的问题。NVIDIA与CoreWeave合作,共同设计全栈平台,帮助领先模型构建者、企业和AI原生企业更快交付生产就绪的AI。
合作背后的工作
依赖这些系统的团队需要在工作负载上线前确保整个堆栈协同运作。我们的团队从概念设计到最新系统的部署和验证,全程协作以优化整个堆栈的性能和效率。NVIDIA提供加速计算平台,CoreWeave提供AI原生云软件和运维层。我们共同确保全栈在生产环境中的表现与验证阶段完全一致。
这项工作始于2026年1月,当时NVIDIA和CoreWeave扩大合作,使用NVIDIA DSX平台在CoreWeave上部署Vera Rubin平台。DSX是NVIDIA关于如何以最大效率和盈利能力规划、构建和运营AI工厂的参考设计。目标是实现更深入的互操作性,确保更强大和高性能的AI工厂能力。得益于此次合作,CoreWeave最近分享了早期性能基准测试结果:Vera Rubin NVL72在相同DeepSeek R1工作负载下,每兆瓦生成的令牌速度达到NVIDIA GB200 NVL72的10倍。这一里程碑展示了我们的团队如何紧密协作,推动下一代AI计算的部署。
实际业绩,而非空谈
两个成果让这一案例广为人知。去年,CoreWeave成为首家部署NVIDIA GB300 NVL72的AI云服务提供商。在MLPerf Training v6.0基准测试中,CoreWeave使用当时最大的NVIDIA GB300 NVL72集群,仅用约两分钟就完成了DeepSeek-V3 671B模型训练。这种表现并非偶然,而是源于在客户依赖之前,每一层技术架构都经过协同设计,并在实际负载验证后才投入生产。这种全栈协作模式体现为:共同设计、部署前验证、规模化运行时信心十足,并延续至下一代硬件。
以下是我们在部署前如何协同设计和验证技术栈,第二部分将探讨其规模化运行及对下一代硬件的影响。
1. 为生产AI协同设计
PFLOPs看似是性能的直观指标,但并不能完整反映实际情况。要实现极致性能,需要在GPU、CPU、网络和存储之间进行深度协同设计。各技术层级必须在交付客户前就同步设计。
在动工前就完成规划
NVIDIA DSX平台汇聚了土地、电力和云服务合作伙伴(包括CoreWeave),在AI工厂建设前就进行规划。这就是深度协同设计:整个生态系统在客户依赖之前就达成共识,明确各层级如何衔接。在新建数据中心动工前,网络、冷却、存储和软件都会同步规划,以确保端到端效率和性能。
NVIDIA通过专为规模化基础设施问题设计的软硬件参考方案提供支持。那些仅在大规模部署时才显现的集成问题,会在客户生产环境之前就被我们的工程师发现并解决。
在典范云中验证性能
NVIDIA典范云是测试规模化性能的关键平台。这是一个通过真实负载而非合成负载衡量每单位总拥有成本(TCO)性能的验证计划。CoreWeave是首批在NVIDIA GB200 NVL72上实现典范云认证的厂商之一。该验证基于由576块Blackwell GPU组成的标准NVIDIA GB200 NVL72集群,通过NVIDIA Quantum-2 InfiniBand互联,并由CoreWeave Mission Control进行性能优化,成功达到NVIDIA设定的大规模训练性能基准。这意味着结果来自客户实际使用的可信配置,而非一次性搭建的测试环境。在推理方面,CoreWeave通过NVIDIA TRT-LLM和SGLang后端配合NVIDIA Dynamo多节点服务,在Blackwell GPU上针对DeepSeek-R1、Llama 3.3和GPT-OSS实现了典范云验证。
延续至下一代硬件
这种严谨性不会因新硬件世代更替而重置。CoreWeave在数周内就将NVIDIA GB300 NVL72系统与CoreWeave Kubernetes Service(CKS)、SUNK、可观测性工具和机架生命周期控制器集成。CoreWeave的敏捷性与对NVIDIA参考设计的深度契合,使其在新一代硬件部署(包括Vera Rubin)方面保持行业领先地位。
延伸至网络和存储
协同设计不仅覆盖计算层,还延伸至网络架构和存储层。CoreWeave同时采用NVIDIA Spectrum-X以太网和NVIDIA Quantum InfiniBand实现低延迟通信,并通过集成LOTA技术的CoreWeave AI对象存储实现高吞吐量数据传输。这种互联和存储架构能够持续为GPU提供算力支持,避免成为跨多机架作业的性能瓶颈。Spectrum-X以太网将新型Spectrum-6 102.4T交换机与ConnectX-9 SuperNIC网卡结合,通过自适应路由和基于遥测的拥塞控制技术,在负载压力下保持带宽稳定性,而普通以太网产品在此场景下性能会显著下降。事实上,CoreWeave是首批部署NVIDIA Spectrum-X Ethernet SN6600-LD的云服务商之一,该产品是业界首款全液冷102.4 Tb/s以太网交换机。CoreWeave也是NVIDIA光子学共封装光学网络技术的早期采用者,该技术专为提升百万级GPU人工智能工厂的能效、系统可靠性和AI工作负载运行时长而设计。
2. 部署前的验证
正确设计系统架构与证明其在真实负载下的稳定性是两个不同概念。客户在将工作负载投入生产环境前,需要了解其行为特征。这意味着要在接近实际部署条件的环境下,测试真实模型、真实配置和真实基础设施表现,从而提前掌握扩展特性与成本驱动因素,而非在生产环境中才发现这些问题。
CoreWeave ARENA正是为此而构建。这是一个生产级验证实验室。团队可在生产级基础设施上运行训练任务、推理工作负载和智能体流水线,提前揭示性能瓶颈并验证扩展性与成本表现,确保实验结果可复现。该实验室运行与客户环境完全一致的系统栈,包括GPU计算、CKS、Slurm和SUNK、集成LOTA的AI对象存储、网络架构以及Mission Control,因此其揭示的性能特征与生产环境完全一致。
虽然MLPerf和Exemplar Cloud验证了CoreWeave的性能表现,客户也可以通过ARENA测试计算环境。在MLPerf Training v6.0基准测试中(该测试衡量训练模型达到预设质量目标所需时间),CoreWeave在8,192块Blackwell Ultra GPU上仅用2.02分钟就完成了DeepSeek-V3 671B基准测试,使用的是该轮测试中规模最大的GB300 NVL72集群,随着集群规模翻倍,完成时间呈近线性下降。
这一最新MLPerf测试结果延续了此前的记录。在MLPerf Training v5.0中,CoreWeave、NVIDIA和IBM提交了当时规模最大的NVIDIA GB200 NVL72集群基准测试,仅用27.3分钟就完成了Llama 3.1 405B测试,相比同规模基于Hopper架构的系统快了2倍以上。连续两轮记录均来自GB200 NVL72和GB300 NVL72集群。两轮测试的共同点在于扩展性表现:随着集群规模扩大,完成时间持续稳定下降,而非在网络或编排成为瓶颈时出现性能衰减。
下一步:运营与演进工厂
协同设计和预部署验证使系统在上线之初就能作为一个整体运行。保持这种状态需要不同的专业能力。接下来,系列文章的第二部分将探讨运营层面的内容,包括健康信号、调度控制和恢复路径,这些机制确保在持续数天或数周的运行中,有用的工作持续流动。随后,它将延续相同的就绪性原则,进入下一代NVIDIA加速计算领域,使客户继承一个经过验证的系统,而非在生产环境中调试全新的架构。
想深入了解?请继续关注以下内容:
- 想亲身体验这种理念?请注册参加2026年9月29日至10月1日于旧金山举办的Fully Connected 2026大会,届时将有在生产环境中运行AI的工程师和运营人员分享实际可行的方案。早鸟优惠截止日期为7月29日。
- 在将工作负载投入生产之前,你可以像CoreWeave一样进行测试。通过探索CoreWeave ARENA,你可以在部署之前,而非之后,在生产级基础设施上验证自己的模型和流水线。
- 想了解最快的NVIDIA GB300 NVL72部署实际是如何实现的吗?阅读完整故事,了解CoreWeave如何仅用数周时间就将该平台投入运行。
生产AI工厂是一个生命周期,而非一次交接。第一部分:NVIDIA和CoreWeave如何协同设计集成优化的技术栈,并在客户部署前完成验证。
分享本文: /分享链接(原文保留)