SemiAnalysis

H100 vs GB200 NVL72 Training Benchmarks – Power, TCO, and Reliability Analysis, Software Improvement Over Time

8.5内容质量
H100 vs GB200 NVL72 Training Benchmarks – Power, TCO, and Reliability Analysis, Software Improvement Over Time

TL;DR · AI 摘要

文章对比分析了H100和GB200 NVL72在训练基准、成本、效率、性能和可靠性方面的差异,指出软件成熟度对GB200 NVL72性能的影响。

核心要点

  • H100在当前阶段比GB200 NVL72更可靠。
  • GB200 NVL72的软件成熟度提升将带来显著的效率增益。
  • Nvidia的H100和H200以及Google TPUs是目前唯一成功完成前沿规模训练的GPU。

结构提纲

按章节快速跳转。

  1. 文章对比分析了H100和GB200 NVL72在训练基准、成本、效率、性能和可靠性方面的差异。

  2. 分析了2000多块H100 GPU的基准测试结果,包括模型浮点利用率(MFU)、总拥有成本(TCO)和每百万个训练令牌的成本。

  3. 比较了每训练一个令牌消耗的功耗,并将其与美国家庭年均能耗进行比较。

  4. 分析了GB200 NVL72在不同软件版本下的性能表现,指出软件成熟度提升将带来显著的效率增益。

  5. 讨论了GB200 NVL72的可靠性问题及其对性能的影响。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • H100 vs GB200 NVL72 Training Benchmarks

金句 / Highlights

值得收藏与分享的关键句。

  • The Hopper vs Blackwell comparisons are not as simple as Nvidia would have you believe.

    第 2 段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • Currently there are no large-scale training runs done yet on GB200 NVL72 as software continues to mature and reliability challenges are worked through.

    第 4 段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • Combined with frontier models architecture being codesigned with the larger scale up world size in mind, we expect that there will be significant efficiency gains from using the GB200 NVL72 by the end

    第 4 段

    ⬇︎ 下载 PNG𝕏 分享到 X
#GPU#AI#NVIDIA#H100#GB200 NVL72
打开原文

H100 与 GB200 NVL72 训练基准分析 - 功耗、总拥有成本和可靠性分析,软件随时间的改进

Image 1: SemiAnalysis
Image 1: SemiAnalysis

[![Image 2: SemiAnalysis](https://substackcdn.com/image/fetch/$s_!EaOc!,e_trim:10:white/e_trim:10:transparent/h_72,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fba5e7f06-f479-4a16-9bb2-4f4ab2164824_6251x2084.png)](https://semianalysis.com/)

订阅 登录

H100 与 GB200 NVL72 训练基准分析 - 功耗、总拥有成本和可靠性分析,软件随时间的改进

每令牌的焦耳数,每百万令牌的总拥有成本,模型浮点利用率 (MFU),每个美国年度家庭能源使用量的令牌数,DeepSeek 670B,GB200 不可靠性,背板停机时间

Dylan PatelDaniel Nishball

2025 年 8 月 20 日

∙ 付费

9

1

分享

前沿模型训练已经将 GPU 和 AI 系统推向了极限,使得成本、效率、功耗、每总拥有成本的性能以及可靠性成为讨论有效训练的核心议题。Hopper 与 Blackwell 的比较并不像英伟达希望你相信的那样简单。

在这份报告中,我们将首先展示超过 2,000 块 H100 GPU 的基准测试结果,分析模型浮点利用率 (MFU)、总拥有成本 (TCO) 以及每训练 1M 令牌的成本数据。我们还将讨论能耗问题,考察每训练一个令牌所消耗的实用焦耳数,并将其与平均美国家庭年能耗进行比较,重新定义功率效率的社会背景。我们还将展示这种分析在从 128 块 H100 扩展到 2048 块 H100 时的结果,并针对不同版本的英伟达软件进行分析。

在本报告的后续部分,我们还将分析 GB200 NVL72 在 Llama4 400B MoE 和 DeepSeek 670B MoE 上的基准测试结果,并将这些数据与我们之前对 H100 的结果进行对比。我们将讨论在考虑可靠性问题后,GB200 NVL72 每美元的性能优势是否仍然存在。

由于可靠性差和工程时间损失导致的停机时间是我们将在每总拥有成本计算中捕获的主要因素之一。目前,由于软件仍在成熟且可靠性挑战尚未解决,尚无大规模训练运行在 GB200 NVL72 上完成。这意味着英伟达的 H100 和 H200 以及谷歌的 TPU 仍然是今天唯一成功用于完成前沿规模训练的 GPU。就目前而言,即使是前沿实验室和云服务提供商中最先进的运营商也尚未能够使用 GB200 NVL72 进行超大规模训练。

话虽如此,每一新架构自然需要时间让生态系统逐步提升软件以有效利用该架构。GB200 NVL72 的提升速度略慢于前几代,但差距不大,我们有信心在年内,GB200 NVL72 的软件会有显著改进。结合前沿模型架构与更大规模的世界尺寸协同设计,我们预计到今年年底,使用 GB200 NVL72 将会带来显著的效率提升。

在可靠性方面,英伟达必须与其合作伙伴更紧密合作,迅速解决持续存在的重大挑战,但我们认为生态系统会迅速集结资源来应对这些可靠性挑战。

SemiAnalysis 正在招聘

我们正在寻找一位应届毕业生工程师加入我们的工程团队。这是一个独特的机会,可以在许多行业领导者和 CEO 的支持下参与高可见度的特别项目。如果你热衷于性能工程、系统可靠性,并希望在硬件和软件交叉领域工作,这是一次难得的机会,可以产生广泛影响。

你将从事的工作:

  • 在多个供应商(AMD、NVIDIA、TPU、Trainium 等)上构建和运行大规模基准测试
  • 设计可重现的 CI/CD 管道以自动化基准测试流程
  • 确保行业合作伙伴使用的系统的可靠性和可扩展性

我们正在寻找的人才:

  • 强大的 Python 技能
  • 站点可靠性工程(SRE)或系统级问题解决背景
  • CI/CD 管道和现代 DevOps 实践的经验
  • 对 GPU、TPU、Trainium、多云和性能基准测试的好奇心

申请链接:https://app.dover.com/apply/SemiAnalysis/2a9c8da5-6d59-4ac8-8302-3877345dbce1

基准测试和分析方法

对于我们的基准测试和分析,我们依赖于英伟达的 DGX 云基准测试脚本,在英伟达内部的 H100 EOS 集群上执行,配置了 8×400 Gbit/s InfiniBand 网络。这些结果作为官方参考数字,当定义 Neoclouds 及其客户之间的服务水平协议(SLAs)时,Neoclouds 可以与之进行比较。

云提供商也可以向英伟达提交基准测试结果,如果他们能够达到这些 EOS 参考数值,那么他们就可以获得 NVIDIA Exemplar Cloud 认证。我们即将推出的 ClusterMAXv2 在评估服务质量时会高度重视提供商用 Exemplar Cloud 状态,因为这一状态是对提供商能够在大规模 GPU 部署中交付参考性能数值的一种认可。

上述基准测试使用 NeMo Megatron-LM 进行,但鉴于许多 GPU 的最终用户并不只依赖于 NeMo Megatron-LM,DGXC 基准测试团队计划扩展覆盖范围到原生 Torch DTensor 框架,例如 TorchTitan。

我们要感谢英伟达 DGXC 基准测试团队创建了这些基准测试并提供了参考数值,以帮助提升 GPU 云行业的水平!

H100 和 GB200 NVL72 资本支出、运营支出和总拥有成本分析

在过去 18 个月内,H100 服务器的价格有所下降,每台服务器的价格约为 190k 美元。包括存储、网络和其他项目,对于典型的超大规模数据中心,每台服务器的初始资本总成本约为 250k 美元。

至于 GB200 NVL72,单个机架规模服务器的成本对于典型的超大规模数据中心约为 310万美元。包括网络、存储和其他项目,所有费用加起来每机架约为 390万美元。

当比较三种不同类型的买家,从超大规模数据中心到新云巨头再到新兴新云,GB200 NVL72 的每 GPU 全部资本总成本大约是 H100 的 1.6 到 1.7 倍。

Image 3
Image 3

来源:SemiAnalysis

比较这两个系统的运营总拥有成本,我们发现 GB200 NVL72 的每 GPU 运营支出并没有比 H100 高出太多。成本差异主要来自于 GB200 NVL72 每 GPU 的全部功耗高于 H100。这主要是因为 GB200 芯片每芯片消耗 1200W 功率,而 H100 是 700W。

Image 4
Image 4

来源:SemiAnalysis

考虑到资本支出和运营支出以计算总拥有成本 (TCO),我们看到 GB200 NVL72 的 TCO 大约比 H100 高 1.6 倍。这意味着 GB200 NVL72 需要比 H100 快至少 1.6 倍才能在每单位 TCO 性能上优于 H100。

Image 5
Image 5

来源:SemiAnalysis

英伟达可以为机器学习社区做得更好的三件事

在深入探讨基准测试和结果之前,我们将提出三个关键建议给英伟达。

首先,我们建议英伟达扩大其基准测试工作,并进一步提高透明度。为了持续提高整个 GPU 云行业的标准,英伟达需要在其超大规模合作伙伴和英伟达云合作伙伴 (NCPs) 中进行基准测试,并公开数据。这样,机器学习社区中的任何人都可以在签署价值数千万甚至数亿美元的合同前,将基准测试数据纳入决策过程。

例如,在我们 ClusterMAX 评分系统的第一版中,我们指出 GCP 较旧的 a3-mega H100 在 O(Llama 70B) 规模训练中的 MFU 平均值低 10%,而在 O(8x7B) 混合专家稀疏模型的 MFU 上低 15-20%。因此,最终用户应该支付比市场平均水平低 10-20% 的租金给 GCP,以实现与市场平均水平相同的每美元性能。拥有一个公开的基准测试结果集,涵盖超大规模数据中心和 NCP 提供商,将大大简化公平合同价格的谈判过程并加快决策速度。这可以通过避免冗长、昂贵且耗时的概念验证运行来节省双方的时间和金钱。

我们的第二个建议是英伟达应该扩大其基准测试的范围,不仅仅局限于 NeMo-MegatronLM,因为许多用户更喜欢使用原生 PyTorch 配合 FSDP2 和 DTensor 而不是 NeMo-MegatronLM。使用 NeMo-MegatronLM 的一个优势在于,在任何时候,NeMo-MegatronLM 中都有许多性能特性尚未在原生 PyTorch 中实现。最新功能首先在 NeMo-Megatron 中推出是合理的,但所有这些功能最多在一个月内应被上游到原生 PyTorch。为此,应该分配更多的英伟达工程师参与 PyTorch 核心开发,而不是专注于为 NeMo 添加更多功能。英伟达扩大基准测试范围还应包括运行 PyTorch,这也将完美地契合这一倡议。

与其让工程师优化 NeMo,不如让他们优化 TorchTitan。新的 NeMo AutoModel 库是一个正确的方向,因为它支持原生 PyTorch FSDP2 后端,除了 Megatron-LM 外,值得注意的是缺少原生 PyTorch 3D+ 并行性与 DTensor,以及许多预训练功能缺失,大多数功能仅适用于微调。

我们第三个建议是英伟达继续加速 GB200 NVL72 背板诊断和调试工具的开发。不幸的是,即使经过广泛的烧录过程,NVLink 铜背板仍然不够可靠。GB200 NVL72 的操作员也抱怨,由于用于诊断和调试背板相关错误的工具落后且不够优化,问题变得更加严重。英伟达还可以通过对其 ODM/OEM 合作伙伴实施更严格的验收测试来改善这种情况,然后再将 GB200 NVL72 机架交给客户。

GPT-3 175B Token/s/GPU,训练性能和功率成本从 2024 年 1 月到 2024 年 12 月的改进

在下表中,我们展示了在不同时间点使用 128 块 H100 集群训练 GPT-3 175B 的基准测试结果。我们选择从 2024 年 1 月开始到 2024 年 12 月结束,分别代表从 H100 大规模部署开始的一年和两年。

基准测试设置使用了 128 块 H100,每个数据副本包含 4 个数据副本。每个数据副本由 32 个 GPU 并行化,每层张量并行化使用 NVLink 域跨 4 个 GPU(即 TP=4),然后进行流水线处理。有人可能会认为最好使用 TP=8 来匹配 H100 的整个 NVLink 域世界大小 8 个 GPU,但对于 GPT-3 175B 模型来说,使用 TP=4 更好,因为这将具有更高的算术强度。

具体来说,GPT3 175B 的隐藏维度为 12,288,这意味着如果使用 TP=8,则结果将是小的 K 减少维度 1,536。相比之下,当使用 TP=4 时,隐藏减少维度将是 3,072。

基准测试的序列长度遵循 原始 GPT-3 论文设置,使用 2,048 的序列长度以及 256 个样本的全局批量大小。这意味着模型将在每次优化器步骤之前看到 500k(全局批量大小 * 序列长度)个标记。

图像 6
图像 6

查看 BF16 模型浮点运算利用率(MFU),我们看到在 12 个月内从 34% 提高到 54%,仅软件方面的改进就带来了 57% 的训练吞吐量提升。这种改进来自英伟达 CuDNN/CuBLAS 工程师编写了更优化的融合 wgmma 内核,NCCL 工程师编写了更优化的集体通信,减少了通信所需的 SM 数量等其他改进。归根结底,是整个软件堆栈的优化起作用。

对于 FP8 MFU,我们也看到了相同趋势,从 29.5% 提高到 39.5%,仅软件方面的改进就带来了 34% 的吞吐量提升。

谈到成本,假设每块 GPU 每小时的成本为 1.42 美元(不包括任何租赁利润),我们看到使用 FP8 训练 GPT-3 175B 的成本从 2024 年 1 月的每百万标记 72 美分下降到 2024 年 12 月的每百万标记 54.2 美分。这意味着使用 原始训练标记数 300B 训练 GPT-3 175B 的成本从 2024 年 1 月的 218,000 美元下降到 2024 年 12 月的 162,000 美元。

最后,我们考察了训练 GPT-3 的功耗。我们估计了 128 块 H100 集群(包括 GPU、CPU、网络、存储和其他组件)的整体功耗。然后根据典型托管数据中心的电力使用效率(PUE)来计算每标记的总功耗。

作为高中物理的一个不受欢迎的回顾,焦耳是一个能量单位,相当于当 1 牛顿力移动物体 1 米时所做的功。点亮一盏 60W 的白炽灯泡持续一秒消耗 60 焦耳(瓦特(W)是一秒内的能量消耗单位),并且每小时消耗 216 千焦。另一种表达能量单位的方式是使用瓦时或千瓦时,这只是设备的功率乘以它被利用的时间。2022 年美国平均家庭每年消耗 10,791 千瓦时的能量,大约相当于 38,847,600,000 焦耳。将这个 10,791 千瓦时除以每年 8,760 小时,我们得到一年中的平均功率约为 1,232 瓦——略高于单个 GB200 GPU 所使用的 1,200 瓦!

我们看到,使用 2024 年 12 月版的 NVIDIA 软件时,每个训练的令牌消耗 2.46 焦耳用于 FP8 和 3.63 焦耳用于 BF16。如果我们有一个相当于美国普通家庭年能源消耗的预算,我们可以训练 158 亿个 FP8 令牌。进一步计算表明,在 GPT3 175B 上训练 3000 亿个令牌需要相当于 19 个美国家庭年能源消耗的电力用于 FP8,而 BF16 则需要 28 个家庭的年能源消耗。

GPT-3 的总训练成本为 16.2 万美元,以及 19 个家庭的年能源消耗听起来并不夸张,但正是许多实验和多次失败的训练运行导致了美国目前看到的人工智能训练能耗的急剧增长。

弱扩展与强扩展

强扩展和弱扩展描述了不同问题设置下扩展计算资源的性能改进,例如不同的批量大小。

强扩展是指在保持模型大小和全局批量大小不变的情况下扩展计算资源。在这种情况下,可以使用 Amdahl 定律来量化强扩展的速度提升。Amdahl 定律描述了通过并行化计算步骤所能达到的速度提升。

另一方面,弱扩展是指以恒定时间解决更大问题时扩展计算资源。人工智能训练本质上利用了弱扩展,因为你可以通过增加用于训练作业的 GPU 数量来扩展模型大小和全局批量大小(取决于收敛情况)。

图像 7
图像 7

来源:SemiAnalysis, 性能和可扩展性 - SCENET 夏季学校

Llama3 405B Token/s/GPU,每百万令牌的成本,每令牌焦耳数与 GPU 数量(弱扩展)

在此基准测试中,我们研究了随着集群中的 H100 GPU 数量增加,Llama3 405B 的训练性能如何变化——这是弱扩展的一个例子。

在下表中,我们可以看到,随着 GPU 集群规模从 576 个 H100 扩展到 2,304 个 H100,FP8 的 MFU 和 BF16 的 MFU 分别保持在约 43% 和 54% 左右。在发表于《Llama 3 Herd of Models 论文》中的训练运行中,研究人员使用了 16,000 个 H100 来训练 Llama 3 405B,在预训练过程中实现了 41% 的 BF16 MFU,使用了类似的并行策略。请注意,上述预训练运行使用了长度为 8192 的序列,而在中期训练上下文扩展时,每个样本的序列长度为 131,072 而不是 8,192。这个更长的序列长度需要跨 16 个节点的上下文并行性,从而由于环注意力所需的额外通信导致 MFU 下降到 38%。

图像 8
图像 8

来源:SemiAnalysis

谈到总训练成本,我们看到仅进行预训练运行,使用 BF16 在 2,304 个 H100 集群上训练 Llama 3 405B 超过 15 万亿个令牌,每百万个令牌的成本为 1.95 美元。这仅仅预训练阶段就达到了 2910 万美元,远高于混合专家模型(如 DeepSeek)的单次训练成本,后者每次训练只需 500 万美元。

当然,我们再次强调,这个成本反映了单次最终成功训练运行的成本,以及到达该最终阶段所需的各种实验的成本,以及其他成本,如雇佣研究人员的成本。

由于 Llama3 405B 的总参数数量大约是 GPT3 175B 的 2.3 倍,因此每令牌的全效焦耳数对于 Llama 3 405B 相比 GPT3 175B 大约高 2.3 倍,分别为 8.8 焦耳/令牌和 3.6 焦耳/令牌。

这意味着,对于相当于美国普通家庭一年消耗的能源,Meta 可以在 Llama3 405B 上使用 BF16 训练 44 亿个令牌。为了使用 15 万亿个令牌训练到收敛,Meta 将需要相当于 3,400 个美国家庭年能源消耗的能量。

Image 9
Image 9

Llama3 405B 的参数量是 Llama3 70B 的 5.7 倍,而任何密集模型所需的浮点运算次数(FLOPs)与参数数量成正比。因此,训练 Llama3 405B 的成本应该是 Llama3 70B 的 5.7 倍。实际上,在大约 2000 张 H100 的规模下,使用 BF16 训练 Llama3 405B 的每百万个 token 的成本高出了 5.4 倍。

在能耗方面,我们看到使用 FP8 训练时,在 2,408 张 H100 上的能耗比在 64 张 H100 上高出 10%。使用 FP8 在 64 张 H100 上训练 Llama3 70B 达到收敛需要的能量仅相当于 440 个美国家庭一年的能源消耗,而在 2,048 张 H100 的规模上,所需的能量相当于 472 个美国家庭一年的能源消耗。

Llama3 8B 训练性能随时间变化

像 Llama3 405B 和 Llama3 70B 这样的大型模型都使用张量并行、管道并行和数据并行,但训练 Llama3 8B 只需在每个 NVLink 域内的每对 GPU 之间进行上下文并行,并使用数据并行将工作分配给其他 GPU 对。在这项分析中,我们还研究了随着时间推移的训练性能,以评估整个软件栈的改进如何影响训练性能。我们发现从 2024 年 11 月到 2025 年 4 月,性能只略有提升,后者日期距离 Hopper 大规模部署已过去了整整 23 个月。

Image 10
Image 10

在下一节中,我们将深入探讨当前 GB200 NVL72 的训练性能与在 H100 上训练的对比。我们将讨论在训练 DeepSeek 670B MoE 和 Llama4 400B MoE 时的基准测试结果,分析 GB200 的总拥有成本(TCO)性能与 H100 的对比。

我们还将深入探讨上述 GB200 NVL72 缺乏有效的诊断和调试工具的问题,并讨论导致 GB200 NVL72 不可靠的许多问题。这些都是 NVIDIA、云服务提供商、Neoclouds 和前沿实验室的终端用户必须解决的挑战,以便在年底前成功且经济高效地在 GB200 NVL72 上训练前沿模型。

本篇文章仅供付费订阅者阅读

订阅

已经是付费订阅者?**登录**

Previous Next

© 2026 Dylan Patel · 隐私政策条款收集通知

开始您的 Substack获取应用程序

Substack 是伟大文化的家园