Networking for AI inference model serving - GKE only and for all other backends

TL;DR · AI 摘要
本文详解AI推理模型服务的两种网络架构设计,分别针对GKE和其他后端,涵盖入口点、通用服务及GKE专用组件,提升部署效率与安全性。
核心要点
- GKE架构使用Inference Gateway和Inference pools实现动态负载均衡
- Private Service Connect通过私有IP保障模型调用网络隔离
- Model Armor提供AI安全检查,防止提示注入和数据泄露
结构提纲
按章节快速跳转。
- §引言
介绍两种AI推理模型服务架构设计的必要性及核心目标。
通过稳定入口点实现安全策略控制与TLS终止。
Private Service Connect、Apigee API Management和Model Armor的共性作用。
解析GKE Inference Gateway与Inference pools的协同工作机制。
通过自动扩展的Model replica sets实现GPU/TPU资源弹性调度。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI推理网络架构
- 入口点设计
- TLS终止
- 安全策略控制
- 通用服务
- Private Service Connect
- Apigee API Management
- Model Armor
- GKE专用组件
- Inference Gateway
- Inference pools
- Model replica sets
金句 / Highlights
值得收藏与分享的关键句。
Private Service Connect通过私有IP地址保持推理调用在私有网络内传输
GKE Inference Gateway作为专用入口引擎,可解析HTTPRoute规则并路由查询
Model Armor作为AI安全检查点,可拦截提示注入和敏感数据泄露
AI 推理模型服务的网络架构 - 仅限 GKE 与其他所有后端 | Google Cloud 博客
开发者与实践者
AI 推理模型服务的网络架构 - 仅限 GKE 与其他所有后端
2026年10月7日
##### Ammett Williams
开发者关系工程师
企业和个人开发者经常需要运行多个 AI 推理模型。合适的架构可以简化模型调用方式,同时提供集中的治理能力。在本文中,我们将探讨两种专注于推理模型服务网络架构的参考架构:一种专为 Google Kubernetes Engine(GKE)设计,另一种适用于所有其他后端类型。首先,我们将分析后续参考架构之间的共性。然后,我们将探讨 GKE 后端架构的独特组件,最后,我们将介绍适用于所有后端类型的架构要素。
入口点
您可以通过一个稳定、安全且可靠的入口点暴露模型部署,该入口点作为推理调用的前端。这个入口点还充当控制区域,可以在其中实施策略、安全性和逻辑。Cloud Load Balancer 和 Inference Gateway 均提供入口点功能。这类端点可以终止 TLS 的安全连接,与 API 管理组件集成,通过服务扩展增强功能,并利用 Model Armor 的能力提升安全性。
设计中的通用服务
两种参考架构均使用以下服务:
- 私有服务连接推理端点:将入口点锚定在您的消费者虚拟私有云(VPC)网络内部。流量会命中私有内部 IP 地址,使推理调用保留在私有网络中。
- Apigee API 管理(可选):通过 Apigee 扩展处理器调用进行集成,用于在请求到达计算资源之前处理客户端身份验证、速率限制和配额执行。
- Model Armor:作为内联 AI 安全检查点,对提示和输出完成进行筛查,防止提示注入和敏感数据泄露。
仅限 GKE 的服务设计模式
本节重点介绍仅限 GKE 的后端设计。要全面理解端到端概念,请阅读完整的架构文档《GKE 上 AI 推理模型服务的网络架构》。该设计模式基于下图:
除了前一节中提到的通用服务外,GKE 架构还使用以下组件:
- GKE 推理网关:作为内部应用负载均衡器(gke-l7-rilb)部署。它充当专用的入口引擎,解析传入请求的有效负载,评估 HTTPRoute 规则,并将查询引导至适当的模型服务目标。
- 推理池:包含相同模型副本的逻辑组。当网关收到提示时,会根据模型标识符评估 HTTPRoute 规则以选择适当的推理池。池具有初始大小,并可配置为动态自动扩展。
- 模型副本集:跨单节点或多节点 GPU 或 TPU 节点池部署的单个模型副本(推理服务器实例)。副本集代表这些模型副本的统一组。
GKE 示例中的流量流程
使用基于 GKE 的架构调用后端模型的客户端应用程序将经历如下流程:
- Ingress:消费者VPC中的客户端应用向本地Private Service Connect端点发起OpenAI兼容的API调用,通过区域内部Application Load Balancer直接路由至GKE推理网关。
- 载荷检查:网关读取请求体中指定的目标模型参数,并将其添加到HTTP头中。
- 控制平面验证:若使用Apigee,会检查客户端凭证和配额。Model Armor会对提示内容进行策略违规或数据泄露筛查。
- 后端选择:网关评估HTTPRoute映射以识别目标池,匹配共享前缀缓存上下文,并根据实时Prometheus数据路由到负载最低的GPU或TPU副本。
- Egress:副本执行推理工作负载。输出令牌通过Model Armor进行最终响应验证后,经私有连接流式返回。
适用于所有后端的设计模式
本节重点介绍可用于推理的多种后端类型,并通过下图概述架构。要全面理解端到端概念,请阅读完整的架构文档《AI推理模型在所有后端上的网络架构》。
对于涉及混合环境(如GKE、Cloud Run、Agent Platform、本地数据中心或外部云)的架构,会使用以下附加组件:
- 区域内部Application Load Balancer:作为中央第7层路由代理,负责管理路由逻辑、SSL终止和服务扩展调用。
- 推理载荷处理器(服务扩展):这与GKE推理网关中基于正文的路由类似,但要在Application Load Balancer上启用该功能需要服务扩展。一个轻量级Cloud Run调用会检查传入OpenAI API请求的JSON正文,提取目标模型标识符,并写入X-Gateway-Model-Name头以驱动URL映射路由。
- 网络端点组(NEG):根据注入的模型头实现对异构后端的灵活路由。
所有后端流量示例
使用此架构调用后端模型的客户端应用会经历以下流程:
- 私有入口:客户端应用通过私有IP地址空间 targeting Private Service Connect端点。区域内部Application Load Balancer接收请求。
- 模型名称提取:负载均衡器将载荷发送至Cloud Run基于正文的路由调用,该调用检查JSON载荷并注入X-Gateway-Model-Name头。
- 策略与安全执行:请求传递至Apigee进行身份和配额验证,然后传递至Model Armor进行敏感数据清理和恶意提示拦截。
- NEG路由:负载均衡器URL映射检查模型头并将请求转发至匹配的后端NEG(Agent Platform、GKE、Cloud Run、混合环境或互联网)。
- 私有传输:目标后端执行模型提示,Model Armor筛查完成结果,结果沿入口路径私有返回。
下一步
深入探索在Google Cloud上构建AI工作负载:
- 文档集:智能体AI架构指南
- 架构中心:Google Cloud多智能体私有网络模式
- 文档:Gemini企业智能体平台网络访问概览
想要提问、了解更多信息或分享想法?请通过LinkedIn与我联系。
分类于
- 开发者与实践者
- 网络技术