GPU Management: Why Idle GPUs Are the New Grounded Aircraft
TL;DR · AI 摘要
GPU利用率决定AI企业经济性,类似航空业飞机利用率,闲置GPU成为新瓶颈。
核心要点
- GPU成本按日历小时计算,收益仅来自计算小时
- 微软为OpenAI建造的超级计算机包含10,000个GPU
- 优化GPU使用效率比单纯增加数量更重要
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- GPU利用率管理
- 成本结构
- 电力/冷却/折旧
- 收益结构
- 计算小时收益
- 优化策略
- 基础设施决策链优化
金句 / Highlights
值得收藏与分享的关键句。
利用率是下一个真正的约束,就像航空业的飞机利用率决定生死
GPU成本按日历小时计算,而收益仅来自计算小时
2020年微软为OpenAI建造的超级计算机包含10,000个GPU
GPU 管理:闲置 GPU 正成为新的“停飞飞机”
返回文章列表
[0
团队
]
文章
发布于 2026 年 7 月 30 日
[-1
点赞
83
[
- +77
Erick Lachmann
ErickvL
关注
Dharma-AI
Gabriel Pimenta de Freitas Cardoso
GabrielPimenta99
Gustavo Lucchetti
gustavolucchetti
利用率,而非智能,将成为 AI 的下一个真实瓶颈
航空业是通过惨痛的教训才明白这一点的。在航空业的大部分历史中,最能预测一家航空公司能否生存的指标,是每架飞机每天在地面停留的时间占比。
原因在于结构本身。飞机的成本是按日历小时累积的:融资、折旧、机身保险、定期维护、机组人员合同。而收入仅按飞行小时产生。每多花一小时在地面,就会压缩收入端的产出,而成本端却照常运行。利用率几乎影响着航空公司的所有运营环节。周转效率、网络设计、维护计划、机组排班和备件可用性最终都会体现在这个数字上,因为底层的任何运营故障都可能让飞机停飞,无论其他环节是否顺利。
更大的机队规模确实有帮助。更多飞机意味着更多可用运力,这是显而易见的。但两家运营相似航线、机队规模相近的航空公司,最终可能产生截然不同的经济效益,而这种差距大多源于一个指标,而非机队规模本身。
企业级 AI 正在以不同的硬件形态遭遇同样的结构性问题。GPU 的成本同样按日历小时累积,无论其当前是否执行有用任务,都要承担融资、折旧、电力和冷却成本。而其产出仅按计算小时产生。更多 GPU 的作用与更大机队对航空公司的帮助类似:增加真实运力,带来实际优势,但并不能保证最终决定成败的结果。两家拥有相似 GPU 预算的公司,其差异越来越取决于硬件在任意时刻执行有用任务的比例,而非各自拥有多少硬件。这个数字,如同航空公司的利用率一样,几乎受公司所有其他基础设施决策的影响。智能能力将行业带到了今天。而下一个真实瓶颈,正在利用率层面形成。
瓶颈从模型转向计算资源
随着 AI 的发展,资源稀缺性并未消失,而是沿着产业链向上转移,最终落在了另一种完全不同的资源上。
企业级 AI 的第一阶段竞争聚焦于模型质量。更大的模型、更多的算力投入、更严苛的基准测试:参数数量和排行榜位置主导了讨论,这场竞赛催生了真正足以支撑企业级工作负载的高质量模型。但这种能力也伴随着一个依赖项。生产级 AI 依赖专用硬件,而目前这种硬件几乎完全由 GPU 构成。
GPU 价格昂贵,供应受限,且需求远超现有库存,即使是市场顶端的设备也是如此。2020 年,微软为 OpenAI 建造了一台专用超级计算机:超过 10,000 块 GPU 和 285,000 个 CPU 核心,当时被报道为全球五大系统之一,用于训练后来成为 GPT-3 的模型。当时,这似乎是一种几乎难以想象的硬件集中度,这种数量让计算资源看起来像是一个只要能获取到就能解决的问题。六年后的今天,这个数字更像是一个起点而非上限。到 2026 年,即使是最资金雄厚的实验室也将计算资源访问视为一个实时战略约束,而非已解决的问题。Anthropic 单独在四个不同的硬件平台(亚马逊、谷歌、微软和 AMD)上同时运行多吉瓦特级的承诺,这些平台在几个月内相继部署,而 Meta 也签署了类似规模的多吉瓦特级协议。当买家拥有近乎无限的资金却仍无法从任何单一来源获得足够资源时,将承诺分散到四个供应商身上就是计算资源稀缺的写照。
六年时间跨度内的两次事件都标志着实验室为保持竞争力所需达到的前沿。其间发生的变化与 AI 能力提升的关系较小,而与能力不再成为限制性因素的关系更大。
这种模式在实验室下游以不同形式再次出现。通过 API 使用这些模型的企业遇到的更多是定价问题而非硬件问题。成本与使用的 token 数量成线性增长,这一事实几乎完全区分了概念验证(PoC)的经济性与生产环境的经济性。每月处理几千次请求的概念验证看起来成本可控。但当相同的工作负载达到生产规模时,成本可能会变成一条永远无法覆盖的支出线。正在兴起的替代方案足够直接:企业自行采购 GPU 并在本地运行模型,用固定的资本支出替代可变的线性成本。
API 成本随使用量增加而上升,而自有基础设施则接近固定成本。超过盈亏平衡点后,这种关系会反转。
这种转变使 GPU 从一项支出变成了基础设施,其规模要适应增长,适应需求高峰,因此其规模会超过任何特定周的实际需求。这意味着采购并未解决问题,反而开启了新的问题。当集群上线的那一天,问题不再是如何获取加速器,而是如何让它们保持忙碌,而只有第一个问题有采购团队负责。签署硬件采购合同是有截止日期和负责人的部分。让这些设备真正投入运行则是决定这笔交易是否值得签署的隐秘环节。
这些协议描述的是容量承诺,而非效率。这些容量的使用效率是另一个问题,由不同的人负责,衡量标准远不如解决程度那么严格。
为什么繁忙的集群仍然浪费容量
一个充满繁忙GPU的集群仍可能浪费大部分潜力,原因几乎总是相同的。GPU全天候持续运行,而对其的需求却并非如此。基础设施必须按峰值进行配置,即在训练运行、批量作业和实时流量同时涌入的那一刻,这导致在峰值之外,大量预分配的容量处于闲置状态。如果每块GPU都能平等处理所有类型的工作负载,更好的预测能力就能单独解决这个问题。但很少有GPU能做到这一点,而这也正是问题中更难解决的部分。
这种不匹配现象从更深层开始显现。
在第一代企业AI中,GPU的主要任务基本是单一的:运行推理。如今,相同的硬件却需要支持训练、微调、量化、实时推理、批量推理、嵌入生成和模型评估,这些工作负载往往属于同一家组织,有时甚至是同一模型,在同一集群中运行。每种工作负载对硬件的需求都截然不同,且差异显著。实时推理几乎在所有方面都优先考虑低延迟,因为响应速度慢会被视为失败。批量处理关注吞吐量并能容忍延迟,有时甚至长达数小时。训练可能需要GPU连续运行数小时甚至数天。量化需要大量容量,但仅需短暂时间。为其中一种工作负载优化的调度器,几乎默认会误配其他三种工作负载。这种失败现象也不一定在利用率仪表盘上显现。集群可能报告高平均占用率,而同时多个排队作业却在等待某个恰好被其他任务占用的GPU配置。
不同组织的工作负载组合各不相同,但问题的本质结构却始终如一。这也是飞机类比开始失效的地方,而这种失效本身揭示了更深层的含义。闲置的飞机通常可以重新部署到舰队中的任何航线:停在芝加哥的737飞机可以改飞丹佛而非达拉斯,损失不大。但闲置的GPU只能吸收那些其内存、延迟和持续时间特征恰好匹配的工作负载。这种差异使得GPU编排比舰队调度更困难,也正因如此,问题不再仅仅是GPU是否被占用,而是变成了“哪种工作负载应该在哪个GPU上运行、何时运行、以何种优先级运行”。购买更多GPU机架只会增加容量和成本,而非解决不匹配问题,而且新容量同样可能在错误的时间以错误的形态闲置,就像已安装的容量一样。
智能融入基础设施
最大化GPU投资回报率需要的不只是单次预分配决策。它要求对基础设施本身进行持续主动的管理,每小时运行一次而非仅在采购时运行一次。为应对这一需求,一种新的学科正在形成:GPU管理,它作为编排层位于工作负载、模型和硬件之间。其职责是持续决定哪些工作负载运行、何时运行、如何运行,以及在集群中的哪块具体GPU上运行。这些概念并不陌生,这更接近优秀运维团队本能所做的工作,只是现在被正式化并持续运行,而非依赖某人发现故障。
智能不仅限于模型边界。编排层正在做出模型本身无法感知的实时资源分配决策。
智能曾经几乎完全依赖于模型本身:更大的规模、更充分的训练、更强的能力,这几乎就是全部的较量。如今,智能还必须存在于基础设施中,存在于实时决定多个竞争性任务负载如何分配刚刚释放的GPU资源,以及相对于队列中其他等待任务的优先级的这一层。保持GPU持续运行的目标不再单纯,因为通过运行低优先级任务来伪造繁忙状态变得容易。真正的目标变成了最大化每块已安装GPU产生的回报,而这一目标实际上是一个比之前资源配置问题更为持续的挑战。
良好的资源配置并未消除这一问题,而是改变了其形态。资源配置决策仅在采购时做出一次。而资源分配决策则持续不断:每次任务完成时,每次新请求到达时,每次面向客户的服务与内部训练任务之间的优先级发生变化时。这种高频次解释了为何这一决策已从人工逐个处理的事务转变为必须自动执行的流程。没有工程师会在凌晨三点盯着仪表盘决定已完成的训练任务是否应将GPU交给排队的批量作业,还是保留给即将到来的客户流量高峰。必须有其他机制持续不断地做出这一判断,并且足够频繁地正确执行,无需人工检查。
这一领域的新颖性使得其工具和规范仍在形成中,目前尚未出现成熟的GPU管理实践的标准方案。至少可以确定的是,约束条件的位置已经发生了转移。
专业化释放容量;编排消耗容量
专业化和编排解决了同一问题的两个不同方面。
专用的小型模型可以在远低于大型通用模型资源消耗的情况下完成特定任务,同时不牺牲任务所需的质量。这会直接影响资源利用率。过去需要占用集群大量容量长时间运行的单一大型模型任务,现在可以改用更小的专用模型运行,仅占用原有容量的一小部分。原本完全被占用的容量突然变得可用。
专业化释放的容量数量因工作负载和模型而异,但释放的容量仍需要被重新分配,否则只能闲置。只有当有机制主动决定如何利用这些释放的容量,将其重新分配给其他任务、其他模型或后续等待的队列时,小型专用模型才能真正转化为GPU的投资回报率。若无人管理,释放的容量会变成另一种形式的空闲状态,虽然不像明显未使用的GPU那样显而易见,但同样不具备生产力。
缺乏编排的专业化会释放无人回收的容量。缺乏专业化的编排则意味着可回收的容量价值更低。单独使用任一手段都无法完成全部工作。
专业化但缺乏编排会释放无人回收的容量。编排但缺乏专业化则从一开始就存在更少值得回收的容量,因为模型仍然庞大且留下的资源占用痕迹较小。没有任何一个杠杆能单独完成全部工作;每个杠杆都为另一个杠杆的潜力设定了更高的上限。如果目标是真正弥合已部署容量与实际产出之间的差距,而非转移浪费发生的地点,那么两者都不可或缺。
这正是为什么模型架构与GPU管理是解决同一问题的两种方式,它们从不同方向切入,最终相互支撑。前者缩小每个工作负载的需求规模,后者则持续决定资源分配的去向。
更大的舰队始终是真正的优势,这里没有任何内容与此相悖。在拥有可比舰队规模的航空公司中,即使较小的航空公司面对更大的竞争对手,胜出的通常是更全面运营自身资源的那方,将航空公司的优势全部承载于其运营之中。企业AI正从不同方向走向同样的纪律性。GPU已经安装、折旧、投入,专业化模型与GPU管理是并行的解决方案,或是双轨策略。专业化缩小每个工作负载的需求,管理则最大化基础设施的回报率。同时掌握这两者的公司将主导未来十年的AI竞争格局。
进一步阅读
- 新模型,同样优势 —— 尽管采用更新架构,DharmaOCR 通过领域专业化和定向训练在巴西葡萄牙语任务中超越了 Mistral OCR4 和 Unlimited-OCR。本文呈现了这一优势的证据及其背后的机制。
- 专业化为何不可避免 —— 专业化论点的结构与理论基础。优化理论、进化生物学、竞争市场和机器学习都指向相同的预测:在有限资源和选择压力下,适应性胜过广度。
- 专业化胜过规模:AI采购决策中最被忽视的战略变量 —— 本文的经验与战略补充。当No Free Lunch定理说明为何专业化在结构上被预测时,本文则探讨了其在实践中表现更优的证据,并解释为何在大多数AI采购决策中仍被低估。
- 文本退化:多数基准未追踪的生产故障模式 —— 语言模型在超出其有效领域边界时出现的已记录故障模式。
- 超越聊天机器人的直接偏好优化 —— 说明偏好优化技术如何扩展到对话AI以外的专用领域,这是本文所论证的领域聚焦策略的具象化体现。
在Hugging Face上探索Dharma AI,体验我们的交互式演示,下载开源模型,发现专用AI系统在真实企业应用中如何超越通用模型。
本文提及的模型 1
本文提及的空间 1
更多来自该作者的文章
新模型,同样优势
55
2026年7月16日
为何专业化不可避免
18
2026年6月30日
社区
Mikeleton
9天前
[2
下一阶段是管理整个智能体舰队,没有任何障碍阻止这一进程。
See translation
- 1 reply
·
Article author
8 days ago
同意。尚未被计入成本的部分在于:代理集群的规模会使每 token 成本与业务规模呈线性增长。当大型企业不再接受这种成本曲线时,他们会将模型部署到内部——这并未消除成本,只是将供应商的价格表替换为利用率数值。而代理集群对资源利用率的要求极为严苛:需在延迟 SLA 下进行实时推理、执行批量作业、重新训练模型、进行评估——所有任务都具有突发性,且都在争夺同一有限的资源池。在很大程度上,管理这些集群将演变为一个 GPU 调度问题。
👍
1
+
blacker521
调度是这个问题的核心瓶颈。如果能在 GPU 上实现类似 CPU 的隔离机制,或采用基于沙箱的架构,将显著缓解这一问题。
BrenoBeleza
6 days ago
很好的观点,隔离确实是整个问题中不可忽视的部分。CPU 风格的资源边界(以及目前正在落地的 GPU 沠箱技术,如 Kata Containers 的工作)使得在同张显卡上安全地部署无关工作负载成为可能,无需担心故障或内存竞争风险,这大大扩展了调度器可选择的部署范围。
进一步思考:当协同部署变得安全后,我们需要决定哪些工作负载在什么时间、以什么优先级运行在哪些 GPU 上,因为每个工作负载对硬件的需求各不相同(内存占用、延迟容忍度、运行时长)。隔离机制提供了更广阔且安全的决策空间,但仍然需要某种机制来选择最佳决策点。而僵化的分区策略甚至可能降低资源利用率,因为闲置的分区无法将容量让渡给繁忙的邻居。
这正是我们下一步要推进的方向:构建智能的作业调度方案。我们正在撰写一篇后续文章,将在下周发布。文章发布后,很期待听到你的见解。
2
jordancros
约15小时前
航空业曾以血的教训认识到这一点。在航空业的大部分历史中,最能预测航空公司能否生存的指标是每架飞机每天有多少时间处于地面状态。
✈️ 将飞机利用率与 GPU 管理进行类比非常具有说服力,因为其底层经济逻辑惊人地相似。就像停在地面的飞机仍然会产生所有权、维护、融资等固定成本却无法创造收入一样,闲置的 GPU 也代表了大量未被利用的计算能力。在现代 AI 和数据中心环境中,昂贵的 GPU 通常是在预期它们将保持高度生产力的情况下采购的,但利用率会因作业调度、数据瓶颈、内存限制、低效的编排,或仅仅是缺乏合适的任务而波动。硬件可能完全正常运作,但每个小时的闲置时间本质上都是未被转化为有用输出的潜在计算时间。📊
⚙️ GPU利用率之所以尤为重要,是因为单纯增加硬件数量并不能自动解决效率问题。如果组织持续扩大GPU集群规模,而现有加速器却因等待任务而空转大量时间,最终可能导致资本支出增加却无法实现产能的相应提升。这与航空公司购买更多飞机却未能改善周转时间、维护协调或调度安排的情况非常相似。真正的竞争优势来自于理解为何产能未被充分利用,并消除这些运营瓶颈。通过更优的任务调度、资源共享、监控、自动扩展和智能分配,通常可以在再次购买昂贵硬件之前,显著提升现有基础设施的产出效率。🚀
📈 我还特别认同一个更宏观的观点:利用率本质上是对底层运营状况的综合度量。在GPU领域,低利用率可能是其他问题的症状而非根本问题本身。模型可能在等待数据,流水线可能优化不足,任务可能在加速器间分布不均,或者内存和网络限制可能阻碍GPU的充分利用。仅关注利用率百分比而忽略背后原因,可能导致错误决策。更有效的方法是将GPU管理视为一项运营学科,通过容量规划、可观测性、任务调度和性能优化的协同作用,持续保持昂贵计算资源的高效运转。
💡 最终,飞机类比凸显了组织在AI基础设施认知上的重要转变。问题不应仅仅是“我们拥有多少GPU?”,而应是“这些GPU实际产生了多少有效工作?”。一个规模较小但管理高效的GPU集群,可能比一个因空转产能而困扰的大型集群带来更好的经济性。随着AI工作负载持续增长,从现有硬件中榨取更多有效时间,可能与获取最新一代加速器同样重要。从这个角度看,空闲的GPU确实正成为数据中心的“停飞飞机”:一种只有在周围运营体系持续推动其运转时才能创造实际价值的昂贵资产。✈️💻
Reply
Edit
Preview
Upload images, audio, and videos by dragging in the text input, pasting, or
clicking here
.
Tap or paste here to upload images
Comment
· Sign up or log in to comment
- +71
/think