Red Hat AI

What is metal to agents? Navigating the architecture of enterprise AI

8.5内容质量

TL;DR · AI 摘要

Red Hat提出的‘metal to agents’框架通过分层架构解决企业AI的基础设施成本和可扩展性问题,支持自研芯片与主流云厂商硬件。

核心要点

  • 企业AI架构需分层设计,从硬件到自主代理共四层,避免供应商锁定
  • 2030年token消耗量预计增长24倍,自主控制硬件可降低推理成本
  • Red Hat AI Enterprise兼容NVIDIA Blackwell Ultra、AMD MI325X等主流加速器

结构提纲

按章节快速跳转。

  1. 企业AI面临基础设施成本激增与技术碎片化双重挑战,需统一架构应对

  2. ‘metal to agents’框架包含硬件层、AI基础设施层、AI平台层和自主代理层四部分

  3. 支持NVIDIA/AMD/Intel加速器及AWS/GCP/Azure自研芯片,实现硬件解耦

  4. 通过‘train once, infer repeatedly’模式降低2030年预计24倍的token消耗成本

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • metal to agents框架
    • 硬件基础
      • NVIDIA/AMD/Intel加速器
      • 云厂商自研芯片
    • 软件栈分层
      • AI基础设施层
      • AI平台层
      • 自主代理层
    • 核心价值
      • 成本控制
      • 架构灵活性

金句 / Highlights

值得收藏与分享的关键句。

#AI架构#企业AI#Red Hat#混合云#自主代理
打开原文

什么是 metal to agents?探索企业级人工智能的架构

Component | Article_teaser

2026年8月13日

6

分钟阅读时间

人工智能

Brian Stevens

人工智能高级副总裁兼首席技术官

Subpattern | social_share_set

Component | social_share

分享

Subpattern | subscribe

Component | social_icon

订阅 RSS

Component | Icon

© Red Hat, Inc. CC-BY-4.0 授权

Subpattern | results_nav

组布局

Component | Nav_links

  • 返回所有文章

Component | Generic

企业人工智能正面临关键转折点,随着组织从孤立的聊天机器人实验转向复杂推理模型和自主代理,生产力提升是真实的,但底层基础设施成本正迅速上升,预计到2030年令牌消耗量将增长24倍。完全依赖外部云和专有API意味着您的支出会随着业务增长直接扩大,带来重大的可预测性和成本问题。

当技术发展如此迅速时,将其视为一系列互不关联的软件工具会产生不必要的技术债务。定制化的支撑架构会创建碎片化的解决方案,无法实现扩展。在2026年Red Hat Summit上,Red Hat首席技术官Chris Wright介绍了用于解决这种复杂性的统一框架,称为metal to agents。我们将这个框架视为一个开放、协作开发的标准人工智能操作系统(AI OS)。几十年前,我们通过在碎片化的服务器环境中构建标准版Linux,为客户提供架构灵活性。构建标准AI OS在智能应用时代实现了同样的目标。

这个集成的开源堆栈从数据中心的物理硬件和加速器一直延伸到提供商业价值的自主AI代理。它为大规模管理优化AI推理工作负载建立了通用平台,支持“训练一次,多次推理”的方法。在混合基础设施上控制整个堆栈有助于您的组织从令牌消费者转变为自己的令牌提供商,帮助您重新掌控推理成本和平台治理。

定义混合云基础和软件堆栈

metal to agents框架将企业人工智能组织为4个相互连接的软件层,建立在灵活的硬件基础之上,最底层是“metal”(硬件),最上层是“agents”(代理服务)。这种结构帮助组织避免供应商锁定,并且能够随着市场变化替换组件。

1. 硬件基础:混合云和加速器选择

在定义软件堆栈之前,企业必须确定其物理部署策略。Red Hat AI Enterprise设计为可在任何主要加速器架构上运行,包括NVIDIA、AMD和Intel的硬件,以及Amazon Web Services(AWS)、Google Cloud和Microsoft Azure云供应商提供的定制硅芯片。该平台包括对NVIDIA Blackwell UltraAMD MI325X加速器等硬件的扩展认证。

2. AI基础设施:构建坚实基础

最低层软件属于IT运营、站点可靠性工程(SRE)和平台工程团队。现代AI基于Linux运行,并使用Kubernetes进行扩展,因此在部署任何模型之前,基础设施稳定性至关重要。

操作系统可靠性

红帽企业Linux(RHEL)为保护数据科学工作负载的生命周期提供了稳定且以安全为核心的基础。

为实现运营可靠性,RHEL 提供以下三大核心能力:

#### 第0天硬件支持

硬件创新周期频繁引入新架构,包括来自 NVIDIA、AMD 和 Intel 的加速器。为避免部署延迟,红帽与硬件合作伙伴直接联合开发,使组织能够利用下一代硬件,在硬件正式发布后立即实现高性能稳定性。

#### 通过镜像模式实现不可变性

红帽企业Linux AI(RHEL AI)通过基于镜像的部署模型,在混合云中标准化扩展。将操作系统内核、硬件优化驱动程序和核心数据科学库打包到单个可启动容器镜像中,可减少配置漂移。这种方法从本地开发人员笔记本电脑到生产数据中心,都提供了统一且可靠的环境。

#### 从硅到代理的机密计算

运营可靠性需要与自主AI工作流兼容的数据保护。RHEL 与硬件级安全框架集成,将可信执行环境从CPU扩展到GPU。这提供了端到端的加密保护,将模型权重和企业数据流与未经授权的访问隔离。

工作负载编排

红帽 OpenShift 作为虚拟机(VM)、容器和AI工作负载的统一 Kubernetes 平台。OpenShift 原生网络隔离控制AI工具可访问的资源范围。此外,通过红帽构建的 Kueue,平台可自动在多个团队之间共享和排队昂贵加速器的任务。这种动态分配可防止在推理调用之间让图形处理单元(GPU)空闲,从而最大化硬件利用率。

3. 推理服务:扩展令牌经济学

推理是性能、可扩展性和运营成本交汇的层级。推理处理不当会导致加速器效率低下、延迟高、用户不满以及云账单不可预测。

为大规模管理令牌经济学,架构将推理服务与基本应用程序逻辑分离。红帽采用 vLLM,这是一个红帽是主要商业贡献者的推理服务开放标准。这种标准化方法带来了巨大的实际节省,例如,Google Cloud 最近为一家全球数字媒体提供商部署了 vLLM,在信任与安全工作负载上实现了成本降低 92%。

由于企业AI请求波动且通常超出单个GPU的容量,红帽开发了 llm-d,这是一个开源分布式推理框架,可智能地在可用硬件基础设施上路由和调度请求。这种协调减少了延迟并提高了吞吐量,与未优化的设置相比,输出令牌数量增加了3倍,首次生成令牌(TTFT)时间加快了10倍。如今,这种优化的推理架构正在帮助企业在工业边缘自动化中实现毫秒级处理,并使机构如法国巴黎银行(BNP Paribas)能够管理超过300个GPU,以规模化提供模型即服务(MaaS)。

随着每周不断涌现的新开源权重和专有大语言模型(LLM),开发者需要在不自行搭建技术栈或依赖影子AI的情况下拥有选择权。模型服务层使企业能够对向内部开发团队提供模型的方式进行集中治理。

当将这一层与红帽OpenShift AI结合时,集成的AI网关为平台管理员提供了一个统一的控制平面,可从单一中心化位置管理令牌配额、凭证访问、请求优先级和精确的令牌速率限制。这意味着如果数据科学团队需要将旧模型替换为更高效的选项,他们可以全局性地进行更改,而无需修改各个应用程序的代码库。

为消除部署的不确定性,红帽AI计划提供的经过验证的模型层提供了经过预优化的、可直接通过红帽OpenShift AI模型目录获取的主要模型压缩版本——例如gemma、gpt-oss、Kimi、Llama、MiniMax、Mistral、Nemotron和Qwen。该层还集成了必要的数据到模型工具,包括包含经过强化版本实用工具(如Docling和Training Hub)的Python仓库,使团队能够从碎片化的实验转向可重复的生产流水线。

5. 代理服务:自主工作流的治理

从金属到代理的堆栈顶层运行着AI代理。与标准聊天界面不同,代理能够推理、规划多步骤操作、调用外部工具,并与其他代理协作完成复杂任务。它们通过循环工作流运行,持续执行和反馈循环,直到任务完成。

然而,由于开发者正在采用各种独立框架(如LangChain、OpenClaw或CrewAI),组织正面临平台快速扩张的问题。开发人员笔记本电脑上运行的代理与数据中心大规模运行的代理之间的差距被称为生产差距(production gap)。未管理的代理部署会带来安全和合规风险,并可能导致基础设施使用量的意外激增。

通过红帽的“自带代理”(bring your own agents)方法结合AgentOps治理,从金属到代理的框架解决了这一挑战。该管理层通过以下方式在企业范围内标准化代理部署:

  • 加密身份:每个自主代理通过SPIFFE/SPIRE获得经过验证和授权的身份,以强制实施对敏感企业资产的最小权限访问。
  • 生命周期管理:IT运维团队可以像管理传统企业应用程序一样对代理进行版本控制、更新和回滚,将其作为标准化系统而非孤立项目进行管理。
  • 通用工具集成:原生支持模型上下文协议(MCP)网关作为通用适配器,无需自定义代码维护即可将代理连接到企业软件即服务(SaaS)API和公司数据库。
  • 内核隔离沙箱:为保护共享基础设施免受失控或恶意代码执行的影响,平台将代理执行限制在受保护的内核隔离边界内。
  • 可观测性:OpenShift AI提供完整的执行追踪和监控功能,用于跟踪代理交互并调试不可预测的行为,将混乱的软件扩张转化为更可靠的代理即服务(AaaS)模式。

从金属到代理框架的战略价值

采用从金属到代理的框架是一种架构决策,会直接影响组织的竞争优势和利润底线。

从令牌消费者转变为令牌提供商

完全依赖外部商业API意味着您的运营成本会随着业务规模直接增长。代理使用循环工作流,消耗的令牌数量远超标准AI模型,因此推理成本可能迅速攀升。通过在混合基础设施上控制全栈,您的组织可以成为自己的令牌提供商——托管经过优化的自托管模型,从而大幅降低总拥有成本(TCO)。

缓解架构蔓延

没有统一平台的情况下,不同业务部门不可避免地会部署孤立的代理平台,导致运营成本上升和碎片化。标准化的从金属到代理架构在提供开发者所需灵活性的同时,保留了组织所需的安全部署、访问控制和合规追踪。

应对市场波动的未来准备

开源模型与专有模型性能相当的时间线已大幅缩短。通过在模块化、开放的基础之上构建AI战略,您可以创建能够适应新技术发展而无需彻底重构架构的基础设施。

成功的AI计划需要从整体环境出发进行审视。Red Hat AI Enterprise提供了所需的连续性,可管理选择、稳定成本,并从物理硅芯片到数字代理开发受保护的自主工作流。

了解更多

  • 了解Red Hat AI Enterprise产品概览
  • 阅读Forrester研究报告:Red Hat AI的总经济影响™
  • 观看网络研讨会:从金属到代理:弥合代理AI的生产差距

Block | Dynamic pattern deluxe promo

Component | Band_header

Resource

适应性强的企业:为什么AI准备就是应对变革的准备

这本电子书由Red Hat首席运营官兼首席安全官Michael Ferris撰写,帮助IT领导者应对当前面临的AI技术变革和颠覆性挑战。

Component | spacer

Component | Cta_multi_basic

Subpattern | simple_cta

Component | CTA

获取资源

Deluxe mbox

Component | Card_header

关于作者

Subpattern | speaker

Card layout

Component | Image_embed

Component | Person

Brian Stevens

Brian Stevens是Red Hat人工智能(AI)业务的高级副总裁兼首席技术官(CTO),他推动公司对开放混合AI未来的愿景。他的工作使企业能够在任何地方构建和部署智能应用,从数据中心到边缘。作为Red Hat工程首席技术官(2001-2014),Brian在公司初期增长和将其产品组合扩展到云、中间件和虚拟化技术方面发挥了核心作用。

在帮助谷歌云扩展规模担任副总裁兼首席技术官后,Brian对变革性技术的热情使他成为Neural Magic的CEO,该公司是软件驱动AI加速的先驱。2025年Red Hat战略收购Neural Magic后,Brian重返公司,将他的领导力与Red Hat使开源成为AI时代基础的使命结合在一起。

阅读该作者的更多作品

类似内容

Dynamic pattern

Blog post

实施代理AI:企业基础设施的第0-2天蓝图

Red Hat on FHIR:为什么一位信息学极客加入了Red Hat

原始播客

使用 PyTorch 标准化 AI 堆栈

技术演讲 | 用开源定义主权 AI

Subpattern | card_flex

Subpattern | text_basic

继续探索

  • 什么是智能体 AI? 文章
  • 预测性 AI 与生成式 AI 文章
  • 构建生产就绪的 AI/ML 环境的关键考虑因素 电子书
  • 以 Ansible 方式实现生成式 AI 视频
  • 通过现代应用平台实现创新与转型 电子书

继续探索 mbox

Subpattern | simple_text

按频道浏览

浏览所有频道

Pattern | raw_html

自动化

有关 IT 自动化在技术、团队和环境中的最新动态

人工智能

关于让客户能够随时随地运行 AI 工作负载的平台的最新动态

开放混合云

探索我们如何通过混合云构建更灵活的未来

安全

关于我们在不同环境和技术中降低风险的最新动态

边缘计算

关于简化边缘运算平台的最新动态

基础设施

关于全球领先的企业的 Linux 平台的最新动态

应用程序

深入了解我们解决最复杂应用程序挑战的方案

虚拟化

企业虚拟化的未来,适用于本地或跨云的工作负载