Claude at scale on Google Cloud: Frontier AI, built for enterprise production

TL;DR · AI 摘要
Title: Claude at scale on Google Cloud: Frontier AI, built for enterprise production URL Source: Published Time: 2026-07...
核心要点
- 主题聚焦:Claude at scale on Google Cloud: Frontier AI, bu
- 来源:Google Cloud Blog,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
在生产环境中运行前沿 AI 是一项极具挑战性的任务——需要管理加速器、保持跨大洲的低延迟、确保敏感数据在区域内存储、可靠处理长上下文请求。Claude on Google Cloud 正是为此而构建。
就像 莫奈与睡莲 一样,前沿模型与企业平台往往相得益彰。在我们这里,Claude 提供推理能力,而 Google Cloud 提供企业已广泛使用的托管基础设施、全球覆盖范围和合规框架。调用 Claude 与调用其他 Google Cloud 服务在操作上完全一致——相同的 身份与访问管理 (IAM)、相同的 VPC 服务控制、相同的可观测性体系,使团队能够专注于功能开发而非推理基础设施运维。
本文将介绍 Claude on Google Cloud 在以下四个领域如何实现企业级生产:
- 释放工程师时间的托管基础设施
- 保持低延迟、高可用性的全球端点
- 继承自 Google Cloud 的安全与数据主权控制
- 实现规模化成本与性能优化的服务层功能
**释放工程时间的托管基础设施**
Claude on Google Cloud 运行在全托管基础设施上,使企业团队能够专注于功能交付而非集群构建。计算资源分配、自动扩展逻辑、负载均衡和前沿模型规模的故障转移均由平台处理——这些工作原本需要多个团队全职投入。
Claude 通过 Agent Platform'sModel Garden 以模型即服务(Model-as-a-Service)形式提供,可通过标准 REST/JSON over HTTP/1.1 或 HTTP/2 端点直接使用。调用 Claude 与调用其他 Google Cloud 服务在操作上完全一致:相同的IAM 策略,相同的 VPC 控制,以及通过 Cloud Logging 和 Cloud Monitoring 的相同可观测性体系。
通过 AnthropicVertex 客户端调用 Claude 仅需几行 Python 代码:
相同的AnthropicVertex客户端支持提示缓存、工具使用、结构化输出、流式传输和自适应思考;如需批量推理,请使用Vertex AI 批量预测。认证使用应用默认凭证;请求会自动继承项目的IAM和VPC配置。
**全球覆盖:一致延迟与内置故障转移**
通过单一端点为全球用户群提供服务会导致尾部延迟较高且存在单点故障。大多数企业无法在保持性能一致的同时跨大洲复制推理基础设施。
Agent Platform 为Claude提供了三种端点类型,分别满足不同的生产需求:
- **全球端点**将请求路由到具有可用AI计算能力的区域。例如,如果us-central1区域资源受限,流量会自动重定向到europe-west1或其他有可用资源的区域。这种自动故障转移和地理负载均衡无需应用端路由逻辑。全球端点适合追求最高可用性和最低成本的场景。
- 区域端点(如us-east5或europe-west1)将提示、完成结果和中间状态保留在特定地理边界内,非常适合低延迟和数据驻留要求。
- **多区域端点**在不依赖单一区域的情况下提供美国或欧盟数据驻留。它们通过区域端点动态路由,内置对区域中断和资源限制的弹性防护。
下图展示了应用程序如何通过这些端点类型访问Claude,以及Agent Platform服务层如何将流量路由到跨区域的Compute AI集群:

通过区域和全球端点提供Claude模型服务

通过多区域端点提供Claude模型服务

通过区域端点提供Claude模型服务
**内置企业级安全与数据主权**
对于受监管的工作负载(如金融服务、医疗保健和政府业务),可在无需牺牲合规性或重新设计最难控制的推理层(提示、完成结果和中间状态均通过服务栈传输)的情况下,获得企业级安全和数据主权。
Agent Platform 上的 Claude 继承了 Google Cloud 的完整安全架构。通过 FedRAMP 高级合规和 HIPAA 合规性,可支持在政府、医疗保健和金融服务环境中部署。VPC 服务控制允许组织围绕 Agent Platform 资源定义边界,防止数据外泄。基于 IAM 的访问控制通过与保护其他所有 Google Cloud 资源相同的角色和策略管理 Claude 端点——无需单独管理或轮换 API 密钥。云日志和云监控可提供近乎实时的令牌使用情况、错误率、延迟和配额消耗的可见性。
结合上述区域和多区域端点,这为受监管客户提供了一条在生产环境中运行前沿 AI 的路径,而无需重新审核其合规性立场。
**针对规模优化的成本和性能**
在生产环境中,成本和性能驱动着每一个架构决策。要同时做好这两方面,需要两个层级的能力:Claude 的原生模型特性,以及 Google Cloud 的服务基础设施。Agent Platform 同时支持这两者,使团队能够在不单独管理它们的情况下跨整个堆栈进行优化。
Claude 原生功能,Agent Platform 完全支持
这些功能直接构建在 Claude 中,并在 Agent Platform 上提供,无需任何额外配置:
- **提示缓存** 存储并重用共享前缀——长系统提示、法律文件、代码库——可将请求延迟降低多达 80%,成本降低多达 90%。
- 通过服务器发送事件的 流式响应 在生成时即时传递令牌,这对感知延迟至关重要的聊天界面和代码助手至关重要。
- 扩展和**自适应思考** 使 Claude 能够动态确定何时以及如何通过复杂、多步骤的问题进行推理——并允许用户直接调整思考力度,例如控制成本。优化用于高级代码生成、数学推理和多文档分析等场景。
- 扩展上下文窗口高达 1M 令牌(适用于 Claude Opus 4.6、Sonnet 4.6 及更新模型)支持长文档分析、大型代码库推理和深度多轮对话。
Google Cloud 服务基础设施
Agent Platform 在 Claude 的原生功能之上增加了自己的服务层能力:
- **批量预测** 处理大规模离线工作负载——文档分类、内容审核、批量摘要——以较低优先级异步执行,降低成本。
- **预置吞吐量** 为关键任务工作负载预留专用推理容量,将其与公共流量隔离,并在需求高峰期间确保性能可预测。
- 长上下文请求的 内存管理和调度 在基础设施层处理。
这两层能力相结合,使团队能够在单一统一平台上获得完整的优化杠杆——从模型级效率到基础设施级容量控制。
**从推理到智能体**
与提供 Claude 推理服务的相同基础设施,也构成了 Google Cloud 上 Agent Platform 的代理层。构建和注册流程包含三个步骤:
- 使用 Claude 构建。Claude 非常适合用作编排核心——其扩展的上下文窗口、原生工具使用能力和适应性思维,使其能够有效规划多步骤任务并委托给子代理。从 Model Garden 中选择 Claude Opus、Sonnet 或 Haiku,然后使用 代理开发工具包(ADK)进行构建——支持 Python、Go、Java 或 TypeScript 的代码优先开发方式,部署到 Agent Runtime、Cloud Run 或 Google Kubernetes Engine。
- 将代理部署到运行时。根据您的使用场景,选择 Agent Runtime、Google Kubernetes Engine 或 GKE Agent Sandbox 来运行已部署的代理。
- 通过 A2A 实现互操作性。Agent2Agent 协议已在 150 多家组织中运行,使注册的 Claude 驱动代理能够将任务委托给来自 SaaS 和其他服务提供商的代理。
结果:基于 Claude 构建的规划代理可以在统一的 IAM 体系下,通过完全可审计的方式,在提供底层推理服务的相同基础设施上,协调更广泛的代理生态系统中的子任务。
**立即开始构建**
打开 Agent Platform 控制台,在 Model Garden 中启用 Claude,并使用 AnthropicVertex SDK 进行首次 API 调用。根据工作负载需求,添加提示缓存、预置吞吐量等其他功能。当您准备构建代理系统时,了解更多关于 Agent Platform 上的 Claude 的信息。
联系您的 Google Cloud 销售代表,讨论如何大规模将 Claude 引入生产环境。
发布于