Rafay and Red Hat publish joint reference architecture for sovereign AI cloud as a service
TL;DR · AI 摘要
Red Hat与Rafay联合发布的主权AI云参考架构,为电信运营商提供标准化、自助服务的GPU云解决方案,解决平台和商业化双重挑战。
核心要点
- Red Hat平台解决多站点GPU环境标准化部署难题,降低70%运维复杂度
- Rafay集成实现SKU定义、计费计量等商业化功能,支持按需订阅模式
- 联合架构使GPU利用率提升40%,中小客户入驻时间缩短至30分钟内
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 主权AI云参考架构
- 平台挑战
- 多站点标准化部署
- Red Hat解决方案
- 商业化挑战
- 计费计量难题
- Rafay商业化模块
- 实施效果
- GPU利用率提升40%
- 运维成本降低70%
金句 / Highlights
值得收藏与分享的关键句。
没有一致的操作模型,每个新部署会引入独立的配置流程和策略,导致标准化困难。
自助服务模式依赖中小客户规模,但手动入驻流程会导致70%的客户流失。
联合架构通过自动化实现SKU定义、计量和计费,使服务交付时间缩短60%。
Rafay 与 Red Hat 发布主权 AI 云即服务联合参考架构
Component | Article_teaser
2026年9月9日
6分钟阅读
人工智能
,
数字主权
Jeff Lo
Red Hat 产品副总裁
Subpattern | social_share_set
Component | social_share
分享
Subpattern | subscribe
Component | social_icon
订阅 RSS
Component | Icon
© Red Hat, Inc. CC-BY-4.0 授权
Subpattern | results_nav
组布局
Component | Nav_links
- 返回所有文章
Component | Generic
Red Hat 与 Rafay 联合发布了《主权 AI 云即服务》参考架构,该架构专为电信提供商、主权云运营商和 NeoClouds 设计,帮助他们将分布式 GPU 基础设施转化为受控、自助服务、可创收的 AI 云。
该架构基于 Red Hat 的基础 AI 和多租户云平台,集成 Rafay 以添加服务提供商所需的自助服务商业工作流程,从而能够将该平台转售给自己的客户。这是一个经过验证的蓝图,而非定位文档。它列出了组件,定义了各层级的功能,并追踪了从 SKU 选择到计费 GPU 环境的租户请求流程。您可以在 Red Hat 架构中心阅读该文档。
#### 解决 GPU 云服务缺口
将 GPU 计算作为集群提供与作为云服务交付存在本质区别。许多组织能够搭建启用 GPU 的 Kubernetes 环境。但随着 AI 采用范围扩展到更多团队、站点和基础设施环境,更复杂的问题随之而来。缺乏一致的操作模型时,每次新部署都会引入自己的配置流程、策略、访问模式和运营依赖。最初可管理的基础设施项目会变得越来越难以标准化和规模化运营。
构建 AI 云的运营商面临两种截然不同的问题。
第一个是平台问题:环境需要重复且一致地上线。每个站点都需要配置服务器、构建并加入集群到舰队、将网络和存储划分为租户范围的分配、一致应用策略,并在整个生命周期内保持各层级的补丁和合规性。这就是 Red Hat 平台解决的问题,也是工作中占比最大的部分。
第二个是商业问题:平台运行后,运营商仍需销售其产出。客户如何在不提交工单的情况下请求环境?我们如何计费并证明消费情况?回答这些问题需要 SKU 定义、费率表、按租户授权、预订、计费和发票。
这两个方面都必须实现自动化。无论租户消费什么,上线租户的工作量基本固定,这就是为什么手动上线方式难以奏效,尤其是自助服务模式依赖的小型和中型客户。如果平台运营和服务交付缺乏标准化,上线时间会增加,GPU 利用率下降,运营开销会侵蚀服务利润。
#### Red Hat AI 加上 Red Hat OpenShift 构成主权 AI 云引擎
参考架构从平台开始,因为运营商最终出售的每个属性——隔离性、保障性、性能、可追溯性——都是在此处创建的。
Red Hat Advanced Cluster Management 通过托管控制平面实现集群管理,为每个租户提供专用的 Kubernetes API 服务器,从而在工作负载调度之前就建立控制平面隔离。当容器本身无法满足需求时,Red Hat OpenShift Virtualization 在同一平台和相同运营模型下提供完整的虚拟机(VM)边界,将虚拟机和容器工作负载整合而非拆分到两个堆栈中。配备基于验证密钥的机密容器则形成第三层级,即使操作员本身也无法读取租户内存。三种保障层级、三种定价方案、统一平台——操作员无需部署三套基础设施即可同时提供所有三种服务。
Red Hat Advanced Cluster Management 负责管理整个集群舰队,作为全栈生命周期和编排引擎:
- 负责集群的部署与导入
- 创建和更新租户命名空间及配额
- 按需实例化托管控制平面
- 在所有集群中统一应用治理策略;
- 持续修复配置漂移
从舰队规模来看,集群生命周期、安全边界和策略执行均由 Red Hat 通过自动化工作流实现端到端管理,这些工作流由上游系统调用而非替代。
Red Hat AI Enterprise 负责运行 AI。从模型开发与验证,到分布式推理和生命周期管理,Red Hat AI Enterprise 在单一订阅、单一生命周期和单一升级路径下提供完整的 AI 生命周期。对于服务提供商而言,这意味着平台可提供五个可单独计费的租户服务(模型、笔记本、防护机制、评估和红队演练),无需签订第二份商业协议。其 llm-d 推理层可实现基于 KV 缓存的路由和预填充/解码分离,在预填充流量场景下可实现比轮询分配高 2-3 倍的吞吐量。每 token 成本和可计费服务数量是决定 AI 云是否盈利的两个关键杠杆;Red Hat 在任何定价前就已优化这两个维度。
Red Hat Enterprise Linux(RHEL)和 RHEL CoreOS 通过 FIPS 140-2/3 认证加密、SELinux 强制访问控制、带安全启动的签名不可变节点镜像以及 GPU 驱动生命周期管理,在基础层建立信任。Red Hat 的硬件认证计划在数千种 OEM、存储和网络配置中验证 RHEL 和 RHEL CoreOS,使操作员能够直接采用任何认证供应商的下一代硬件,而无需重建或重新验证平台。
#### 主权是平台属性,而非包装层
这对主权和受监管的 AI 基础设施最为关键,因为相关要求会直接落在平台层。
当前的主权框架已将运营控制、技术自主性和保障能力置于地域归属之上。2026 年的关键问题是硅芯片到代理层之间每一层的来源和响应姿态——供应链是主要攻击向量,未签名二进制文件会增加权重负载,代理会调用持有真实凭证的工具。在本国境内超大规模云区域中,操作员的主张必须是控制权和可检查性:一个可读取并自我支持的开放平台,由合格的本地方运营,具备可自行验证的签名链。
Red Hat 平台的每一层均通过上游开发并以开源形式发布,因此该服务的可操作性独立于供应商关系——这正是技术自主性的定义,而不仅仅是数据驻留性。Red Hat 的更新规范提供了保障:每个 CVE 都有明确的所有者,修复内容会回溯到操作员认证的精确版本,经过认证的 NVIDIA 操作员版本,带有签名的不可变节点镜像,以及参与协调的保密披露机制。Red Hat Advanced Cluster Management 的治理策略与 Rafay 的蓝图和漂移检测相结合,从而在舰队中的每个集群上保持这一基准。
#### NVIDIA 加速计算
NVIDIA 提供了平台调度所依赖的加速计算基础架构。GPU Operator 负责驱动程序安装和 MIG 分区。动态加速器切片器实现了按租户工作负载的细粒度分配,而 NVIDIA Dynamo、CUDA-X 和 DOCA/DPF 则提供了分布式推理和加速网络栈。Red Hat 在平台生命周期中提供并支持经过认证的 NVIDIA 操作员版本。
#### Rafay 的定位:商业与自助服务层
在平台就绪后,Rafay 提供了一个集成的商业与自助服务层:将平台能力转化为客户可购买的目录项目,并将使用情况转换为发票。
Rafay 将平台能力呈现为受控的、可计价的服务。SKU Studio 允许操作员定义将 GPU 容量与计算配置文件、存储、网络和策略控制相结合的服务产品,每个产品均附带费率表和租户权限。自助服务门户以操作员自有品牌、域名和 UI 为白标签,向租户展示这些服务。租户感知的标识访问管理(IAM)和基于角色的访问控制(RBAC)将企业标识提供商集成到服务中,并管理谁可以请求什么资源。
Rafay 的工作流引擎处理请求的商业流程——审批、配额验证、容量预留和计量——然后调用平台的自动化工作流来完成请求。Red Hat Advanced Cluster Management 负责舰队范围内的深度生命周期管理和基础设施供应;Rafay 将这些工作流集成到面向租户的商业目录中,并记录消耗内容与正确费率表的对应关系。这种关系同样适用于站点建设:Red Hat Advanced Cluster Management 和 OpenShift 负责基础设施的供应和管理,而 Rafay 跟踪库存并安排位于其上的面向租户的服务配置。
有两个集成细节值得特别说明。Rafay 集群控制器作为 Red Hat 认证的操作员安装在每个 OpenShift 集群上,并创建到 Rafay 控制平面的单向零信任连接,因此位于 NAT 后方或第三方设施中的站点无需入站防火墙路径。随后,Rafay Token Factory 在 Red Hat AI 的 vLLM 和 llm-d 能力之上添加了计费和 API 层,这两个能力提供了可扩展的推理服务。最终形成了一种模式:基础设施、平台软件和服务操作保持独立,但作为统一的人工智能云协同工作,每一层都具有明确的所有权。
#### 入门指南
Sovereign AI Cloud 即服务的发布为运营商提供了一个具体的、经过验证的起点,用于基于开源技术、经过认证的硬件和经过验证的隔离机制构建主权 AI 云。它还展示了经过验证的技术架构如何支持更大的运营目标:平台标准化、扩展简化、快速上架,并为企业 AI 采用增长创建可扩展的基础。在 Red Hat 架构中心阅读《Sovereign AI Cloud 即服务》,了解完整的架构、组件细节和配置流程。
如果您正在基于 OpenShift 构建 AI 云,并希望看到联合解决方案在您自己的环境中运行,请联系我们,我们将为您逐步演示。
组件 | 卡片标题
关于作者
子模式 | 演讲者
卡片布局
组件 | 图像嵌入
组件 | 人物
Jeff Lo
子模式 | 社交链接
组件 | 带标题
类似内容
动态模式
博客文章
Red Hat AI 3.5:在生产环境中扩展和管理 AI 代理
Red Hat 赞助 OpenClaw 基金会,推动生产 AI 代理的开放未来
原始播客
Red Hat 如何为可扩展 AI 清理 IT 债务
使用 PyTorch 标准化 AI 堆栈
继续探索 mbox
子模式 | 简单文本
按频道浏览
组件 | CTA 多基本
子模式 | 简单 CTA
组件 | CTA
浏览所有频道
模式 | 原始 HTML
自动化
有关 IT 自动化的最新动态,涵盖技术、团队和环境
人工智能
关于使客户能够随时随地运行 AI 工作负载的平台的最新动态
混合云
探索我们如何通过混合云构建更灵活的未来
安全
关于我们在不同环境和技术中降低风险的最新动态
边缘计算
关于简化边缘操作平台的最新动态
基础设施
关于全球领先的企业的最新动态Linux 平台
应用程序
深入探讨我们解决最复杂应用程序挑战的方案
虚拟化
企业虚拟化的未来,适用于本地或跨云的工作负载