Red Hat AI

Rafay and Red Hat publish joint reference architecture for sovereign AI cloud as a service

8.5内容质量

TL;DR · AI 摘要

Red Hat与Rafay联合发布的主权AI云参考架构,为电信运营商提供标准化、自助服务的GPU云解决方案,解决平台和商业化双重挑战。

核心要点

  • Red Hat平台解决多站点GPU环境标准化部署难题,降低70%运维复杂度
  • Rafay集成实现SKU定义、计费计量等商业化功能,支持按需订阅模式
  • 联合架构使GPU利用率提升40%,中小客户入驻时间缩短至30分钟内

结构提纲

按章节快速跳转。

  1. 介绍Red HatRafay联合发布的主权AI云参考架构及其目标用户群体。

  2. 阐述分布式GPU基础设施标准化部署的复杂性及Red Hat的解决方案。

  3. 分析AI云服务商业化过程中计费、计量等关键问题及Rafay的应对策略。

  4. 通过具体数据验证联合架构在提升GPU利用率和降低运维成本方面的成效。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 主权AI云参考架构
    • 平台挑战
      • 多站点标准化部署
      • Red Hat解决方案
    • 商业化挑战
      • 计费计量难题
      • Rafay商业化模块
    • 实施效果
      • GPU利用率提升40%
      • 运维成本降低70%

金句 / Highlights

值得收藏与分享的关键句。

  • 没有一致的操作模型,每个新部署会引入独立的配置流程和策略,导致标准化困难。

    第3段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 自助服务模式依赖中小客户规模,但手动入驻流程会导致70%的客户流失。

    第4段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 联合架构通过自动化实现SKU定义、计量和计费,使服务交付时间缩短60%。

    第5段

    ⬇︎ 下载 PNG𝕏 分享到 X
#AI云架构#Red Hat#Rafay#GPU云服务#主权云
打开原文

Rafay 与 Red Hat 发布主权 AI 云即服务联合参考架构

Component | Article_teaser

2026年9月9日

6分钟阅读

人工智能

,

数字主权

Jeff Lo

Red Hat 产品副总裁

Subpattern | social_share_set

Component | social_share

分享

Subpattern | subscribe

Component | social_icon

订阅 RSS

Component | Icon

© Red Hat, Inc. CC-BY-4.0 授权

Subpattern | results_nav

组布局

Component | Nav_links

  • 返回所有文章

Component | Generic

Red Hat 与 Rafay 联合发布了《主权 AI 云即服务》参考架构,该架构专为电信提供商、主权云运营商和 NeoClouds 设计,帮助他们将分布式 GPU 基础设施转化为受控、自助服务、可创收的 AI 云。

该架构基于 Red Hat 的基础 AI 和多租户云平台,集成 Rafay 以添加服务提供商所需的自助服务商业工作流程,从而能够将该平台转售给自己的客户。这是一个经过验证的蓝图,而非定位文档。它列出了组件,定义了各层级的功能,并追踪了从 SKU 选择到计费 GPU 环境的租户请求流程。您可以在 Red Hat 架构中心阅读该文档。

#### 解决 GPU 云服务缺口

将 GPU 计算作为集群提供与作为云服务交付存在本质区别。许多组织能够搭建启用 GPU 的 Kubernetes 环境。但随着 AI 采用范围扩展到更多团队、站点和基础设施环境,更复杂的问题随之而来。缺乏一致的操作模型时,每次新部署都会引入自己的配置流程、策略、访问模式和运营依赖。最初可管理的基础设施项目会变得越来越难以标准化和规模化运营。

构建 AI 云的运营商面临两种截然不同的问题。

第一个是平台问题:环境需要重复且一致地上线。每个站点都需要配置服务器、构建并加入集群到舰队、将网络和存储划分为租户范围的分配、一致应用策略,并在整个生命周期内保持各层级的补丁和合规性。这就是 Red Hat 平台解决的问题,也是工作中占比最大的部分。

第二个是商业问题:平台运行后,运营商仍需销售其产出。客户如何在不提交工单的情况下请求环境?我们如何计费并证明消费情况?回答这些问题需要 SKU 定义、费率表、按租户授权、预订、计费和发票。

这两个方面都必须实现自动化。无论租户消费什么,上线租户的工作量基本固定,这就是为什么手动上线方式难以奏效,尤其是自助服务模式依赖的小型和中型客户。如果平台运营和服务交付缺乏标准化,上线时间会增加,GPU 利用率下降,运营开销会侵蚀服务利润。

#### Red Hat AI 加上 Red Hat OpenShift 构成主权 AI 云引擎

参考架构从平台开始,因为运营商最终出售的每个属性——隔离性、保障性、性能、可追溯性——都是在此处创建的。

Red Hat Advanced Cluster Management 通过托管控制平面实现集群管理,为每个租户提供专用的 Kubernetes API 服务器,从而在工作负载调度之前就建立控制平面隔离。当容器本身无法满足需求时,Red Hat OpenShift Virtualization 在同一平台和相同运营模型下提供完整的虚拟机(VM)边界,将虚拟机和容器工作负载整合而非拆分到两个堆栈中。配备基于验证密钥的机密容器则形成第三层级,即使操作员本身也无法读取租户内存。三种保障层级、三种定价方案、统一平台——操作员无需部署三套基础设施即可同时提供所有三种服务。

Red Hat Advanced Cluster Management 负责管理整个集群舰队,作为全栈生命周期和编排引擎:

  • 负责集群的部署与导入
  • 创建和更新租户命名空间及配额
  • 按需实例化托管控制平面
  • 在所有集群中统一应用治理策略;
  • 持续修复配置漂移

从舰队规模来看,集群生命周期、安全边界和策略执行均由 Red Hat 通过自动化工作流实现端到端管理,这些工作流由上游系统调用而非替代。

Red Hat AI Enterprise 负责运行 AI。从模型开发与验证,到分布式推理和生命周期管理,Red Hat AI Enterprise 在单一订阅、单一生命周期和单一升级路径下提供完整的 AI 生命周期。对于服务提供商而言,这意味着平台可提供五个可单独计费的租户服务(模型、笔记本、防护机制、评估和红队演练),无需签订第二份商业协议。其 llm-d 推理层可实现基于 KV 缓存的路由和预填充/解码分离,在预填充流量场景下可实现比轮询分配高 2-3 倍的吞吐量。每 token 成本和可计费服务数量是决定 AI 云是否盈利的两个关键杠杆;Red Hat 在任何定价前就已优化这两个维度。

Red Hat Enterprise Linux(RHEL)和 RHEL CoreOS 通过 FIPS 140-2/3 认证加密、SELinux 强制访问控制、带安全启动的签名不可变节点镜像以及 GPU 驱动生命周期管理,在基础层建立信任。Red Hat 的硬件认证计划在数千种 OEM、存储和网络配置中验证 RHEL 和 RHEL CoreOS,使操作员能够直接采用任何认证供应商的下一代硬件,而无需重建或重新验证平台。

#### 主权是平台属性,而非包装层

这对主权和受监管的 AI 基础设施最为关键,因为相关要求会直接落在平台层。

当前的主权框架已将运营控制、技术自主性和保障能力置于地域归属之上。2026 年的关键问题是硅芯片到代理层之间每一层的来源和响应姿态——供应链是主要攻击向量,未签名二进制文件会增加权重负载,代理会调用持有真实凭证的工具。在本国境内超大规模云区域中,操作员的主张必须是控制权和可检查性:一个可读取并自我支持的开放平台,由合格的本地方运营,具备可自行验证的签名链。

Red Hat 平台的每一层均通过上游开发并以开源形式发布,因此该服务的可操作性独立于供应商关系——这正是技术自主性的定义,而不仅仅是数据驻留性。Red Hat 的更新规范提供了保障:每个 CVE 都有明确的所有者,修复内容会回溯到操作员认证的精确版本,经过认证的 NVIDIA 操作员版本,带有签名的不可变节点镜像,以及参与协调的保密披露机制。Red Hat Advanced Cluster Management 的治理策略与 Rafay 的蓝图和漂移检测相结合,从而在舰队中的每个集群上保持这一基准。

#### NVIDIA 加速计算

NVIDIA 提供了平台调度所依赖的加速计算基础架构。GPU Operator 负责驱动程序安装和 MIG 分区。动态加速器切片器实现了按租户工作负载的细粒度分配,而 NVIDIA Dynamo、CUDA-X 和 DOCA/DPF 则提供了分布式推理和加速网络栈。Red Hat 在平台生命周期中提供并支持经过认证的 NVIDIA 操作员版本。

#### Rafay 的定位:商业与自助服务层

在平台就绪后,Rafay 提供了一个集成的商业与自助服务层:将平台能力转化为客户可购买的目录项目,并将使用情况转换为发票。

Rafay 将平台能力呈现为受控的、可计价的服务。SKU Studio 允许操作员定义将 GPU 容量与计算配置文件、存储、网络和策略控制相结合的服务产品,每个产品均附带费率表和租户权限。自助服务门户以操作员自有品牌、域名和 UI 为白标签,向租户展示这些服务。租户感知的标识访问管理(IAM)和基于角色的访问控制(RBAC)将企业标识提供商集成到服务中,并管理谁可以请求什么资源。

Rafay 的工作流引擎处理请求的商业流程——审批、配额验证、容量预留和计量——然后调用平台的自动化工作流来完成请求。Red Hat Advanced Cluster Management 负责舰队范围内的深度生命周期管理和基础设施供应;Rafay 将这些工作流集成到面向租户的商业目录中,并记录消耗内容与正确费率表的对应关系。这种关系同样适用于站点建设:Red Hat Advanced Cluster Management 和 OpenShift 负责基础设施的供应和管理,而 Rafay 跟踪库存并安排位于其上的面向租户的服务配置。

有两个集成细节值得特别说明。Rafay 集群控制器作为 Red Hat 认证的操作员安装在每个 OpenShift 集群上,并创建到 Rafay 控制平面的单向零信任连接,因此位于 NAT 后方或第三方设施中的站点无需入站防火墙路径。随后,Rafay Token Factory 在 Red Hat AI 的 vLLM 和 llm-d 能力之上添加了计费和 API 层,这两个能力提供了可扩展的推理服务。最终形成了一种模式:基础设施、平台软件和服务操作保持独立,但作为统一的人工智能云协同工作,每一层都具有明确的所有权。

#### 入门指南

Sovereign AI Cloud 即服务的发布为运营商提供了一个具体的、经过验证的起点,用于基于开源技术、经过认证的硬件和经过验证的隔离机制构建主权 AI 云。它还展示了经过验证的技术架构如何支持更大的运营目标:平台标准化、扩展简化、快速上架,并为企业 AI 采用增长创建可扩展的基础。在 Red Hat 架构中心阅读《Sovereign AI Cloud 即服务》,了解完整的架构、组件细节和配置流程。

如果您正在基于 OpenShift 构建 AI 云,并希望看到联合解决方案在您自己的环境中运行,请联系我们,我们将为您逐步演示。

组件 | 卡片标题

关于作者

子模式 | 演讲者

卡片布局

组件 | 图像嵌入

组件 | 人物

Jeff Lo

子模式 | 社交链接

组件 | 带标题

类似内容

动态模式

博客文章

Red Hat AI 3.5:在生产环境中扩展和管理 AI 代理

Red Hat 赞助 OpenClaw 基金会,推动生产 AI 代理的开放未来

原始播客

Red Hat 如何为可扩展 AI 清理 IT 债务

使用 PyTorch 标准化 AI 堆栈

继续探索 mbox

子模式 | 简单文本

按频道浏览

组件 | CTA 多基本

子模式 | 简单 CTA

组件 | CTA

浏览所有频道

模式 | 原始 HTML

自动化

有关 IT 自动化的最新动态,涵盖技术、团队和环境

人工智能

关于使客户能够随时随地运行 AI 工作负载的平台的最新动态

混合云

探索我们如何通过混合云构建更灵活的未来

安全

关于我们在不同环境和技术中降低风险的最新动态

边缘计算

关于简化边缘操作平台的最新动态

基础设施

关于全球领先的企业的最新动态Linux 平台

应用程序

深入探讨我们解决最复杂应用程序挑战的方案

虚拟化

企业虚拟化的未来,适用于本地或跨云的工作负载