NVIDIA Vera Rubin NVL72 on CoreWeave: 10x More Tokens Per Megawatt Than Blackwell

TL;DR · AI 摘要
NVIDIA Vera Rubin NVL72在能耗效率上比Blackwell提升10倍,适合大规模AI推理。
核心要点
- Vera Rubin NVL72在相同功耗下生成的token数量是Blackwell的10倍
- NVFP4精度和多token预测优化技术是性能提升的关键
- 网络安全公司可扩展10倍终端威胁检测能力不增加机房面积
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- NVIDIA Vera Rubin NVL72性能对比
- 性能优势
- 10倍token/兆瓦效率
- 优化技术
- NVFP4精度
- 多token预测
- 应用场景
- 网络安全
- 编码代理
- 搜索引擎
金句 / Highlights
值得收藏与分享的关键句。
Vera Rubin NVL72在相同交互目标下生成的token数量是Blackwell的10倍
NVFP4精度和多token预测技术使能效提升达数量级
网络安全公司可扩展10倍终端威胁检测能力不增加机房面积
首次测量的NVIDIA Vera Rubin NVL72硅性能数据 | CoreWeave博客
发布于
2026年7月21日
4
分钟阅读
CoreWeave上的NVIDIA Vera Rubin NVL72:每兆瓦令牌数量是Blackwell的10倍
作者
Harsh Singh Banwait
$
/$
已复制
6月初,CoreWeave完成了NVIDIA Vera Rubin NVL72的行业首次启动和验证,实现了从机架级系统端到端的部署,电源、冷却、网络和计算功能均经过验证并正常运行。这一里程碑证明了该平台已具备生产规模的运行能力。接下来所有人都关心的问题是:性能表现如何?今天,我们很高兴分享首次测量的Vera Rubin NVL72硅性能数据。
当前推动智能体AI激增的推理模型DeepSeek R1,同时在Vera Rubin NVL72和NVIDIA Blackwell NVL72上进行了测试。在此次评估中,以交互性(以TPS/用户衡量)为基准测量了每兆瓦的令牌吞吐量,这反映了用户或智能体在模型推理任务时的响应速度。在匹配的交互性目标下,Vera Rubin NVL72在相同的DeepSeek R1工作负载中,每兆瓦的令牌生成速度达到NVIDIA GB200 NVL72的10倍。
在提供相似用户交互性的同时,Vera Rubin NVL72在相同TPS/用户下,相比GB200 NVL72实现了每单位能耗高达10倍的每兆瓦令牌数量提升。
这项性能提升的真正意义
此次评估在每个平台上均启用了所有主要的最先进推理优化技术。这些优化包括大规模专家并行、NVFP4精度、多令牌预测以及分离预填充和解码功能,均通过NVIDIA TensorRT-LLM和NVIDIA Dynamo实现。在相似的交互性目标下,Vera Rubin NVL72实现了每兆瓦令牌吞吐量数量级的提升,使CoreWeave客户能够在相同功耗预算下运行更多推理模型流量,或以更少的功耗运行相同流量。这意味着更低的每令牌成本和在相同基础设施投资下更大的扩展空间,这对需要调用工具并跨多步骤推理的智能体工作负载具有显著优势。
实际应用效果如下:
- 一家全球网络安全公司预计能以每瓦性能提升10倍的效率运行威胁检测推理,使其能够在不扩大数据中心规模的情况下扩展智能体安全至更多终端。
- 一家自主编码智能体公司预计在每GPU推理性能上实现类似飞跃,同时将令牌成本降至原有水平的很小一部分,使智能体能更长时间专注于复杂问题而不破坏单位经济模型。
- 一家正在GB200 NVL72上运行的原生AI搜索引擎预计在每GPU推理吞吐量上实现类似飞跃,使其能在不牺牲响应时间目标的前提下,将实时引用答案搜索扩展至更多用户。
使用NVIDIA Vera Rubin NVL72扩展智能体AI
像DeepSeek R1这样的推理模型不会通过单次推理得出答案。它们会制定计划、检查自身工作并进行修订,每个查询生成的令牌数量远超典型响应。所有这些令牌都必须通过内存并在NVLink域内传输,这使得交互性(而非单纯的FLOPs数值)成为决定智能体是即时响应还是迟滞的关键指标。
这正是NVIDIA Vera Rubin NVL72所要解决的限制。72块NVIDIA Rubin GPU和36块NVIDIA Vera CPU共享一个机架,通过260 TB/s的全互联NVLink 6架构连接,Transformer引擎原生支持NVFP4协议。
我们在其底层运营层投入了大量资源,确保当客户的工作负载在生产环境中大规模运行时,这些效率提升能够持续保持。我们之前曾撰文介绍过CoreWeave如何通过专利液冷技术(Valvey)和统一机架控制(Racky),配合我们的机架生命周期控制器(Rack LifeCycle Controller),实现机架级AI作为云服务的运营。
为更多性能提升奠定基础
我们之前见过这种模式。当CoreWeave上线GB200 NVL72时,随着我们在硬件周边对调度、网络和软件栈的持续优化,后续几个月的初始推理性能显著提升。这些工作体现在我们的破纪录MLPerf推理提交结果,以及两分钟完成DeepSeek-V3训练基准测试等成果中。我们预计此次也将遵循相同的发展轨迹:当前的性能数据是Vera Rubin NVL72的起点,随着优化工作的推进,我们将继续发布更新的数值。
准备好规划您的Vera Rubin NVL72路线图了吗?请通过此链接联系我们。想深入了解?请查看以下内容:
- 深入了解我们针对NVIDIA Vera Rubin NVL72的工程工作
- 查看NVIDIA Vera Rubin在CoreWeave Cloud上的表现
- 观看回放:与SiliconAngle的theCUBE共同直播的《借助NVIDIA Vera Rubin NVL72扩展智能时代》
CoreWeave发布首个NVIDIA Vera Rubin NVL72的硅芯片性能实测数据,标志着AI基础设施迈入新的里程碑。
分享本文: /