AWS Machine Learning Blog

Introducing cross-Region inference for OpenAI GPT-5.6 models on Amazon Bedrock

8.5内容质量
Introducing cross-Region inference for OpenAI GPT-5.6 models on Amazon Bedrock

TL;DR · AI 摘要

AWS Bedrock推出跨区域推理功能,支持OpenAI GPT-5.6模型在25个区域运行,提升性能和扩展性。

核心要点

  • 跨区域推理(CRIS)通过推理配置文件实现,允许请求在多个AWS区域间路由,提升吞吐量。
  • GPT-5.6的Sol/Terra/Luna变体支持不同成本与能力平衡,适用于不同场景。
  • 全球CRIS配置文件可跨所有AWS商业区域路由请求,提供更广泛的计算资源池。

结构提纲

按章节快速跳转。

  1. AWS Bedrock推出跨区域推理功能,支持OpenAI GPT-5.6模型在25个区域运行。

  2. 跨区域推理通过推理配置文件定义模型和AWS区域,提升吞吐量并保持性能。

  3. Sol/Terra/Luna三种变体分别针对不同成本与能力平衡,适用于不同使用场景。

  4. 支持通过OpenAI Responses API、Chat Completions API和Bedrock Converse API调用模型。

  5. 全球CRIS配置文件可跨所有AWS商业区域路由请求,提供更广泛的计算资源池。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AWS Bedrock跨区域推理
    • 核心机制
      • 推理配置文件
    • 模型变体
      • Sol
      • Terra
      • Luna
    • 调用方法
      • OpenAI API
      • Bedrock Converse API

金句 / Highlights

值得收藏与分享的关键句。

  • 跨区域推理(CRIS)通过推理配置文件定义模型和AWS区域,提升吞吐量并保持性能。

    第2段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 全球CRIS配置文件可路由到所有支持的AWS商业区域,提供更广泛的计算资源池。

    第3段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • Sol/Terra/Luna三种变体分别针对不同成本与能力平衡,适用于不同使用场景。

    第2段

    ⬇︎ 下载 PNG𝕏 分享到 X
#AWS Bedrock#GPT-5.6#跨区域推理#OpenAI#机器学习
打开原文

在 Amazon Bedrock 上为 OpenAI GPT-5.6 模型引入跨区域推理 | 人工智能

在 Amazon Bedrock 上为 OpenAI GPT-5.6 模型引入跨区域推理

本文与 OpenAI 的 Chris Dickens 联合撰写。

Amazon Bedrock 现在在超过 25 个 AWS 区域提供 OpenAI GPT-5.6 模型,并支持跨区域推理。Sol、Terra 和 Luna 三种 GPT-5.6 变体支持跨区域推理,每种变体针对能力与成本的不同平衡进行了优化。

Amazon Bedrock 的跨区域推理(CRIS)通过推理配置文件实现,配置文件定义了模型和 Amazon Bedrock 可将请求路由到的 AWS 区域。您从源区域调用配置文件,Amazon Bedrock 会使用目标区域的计算资源将请求路由到目标区域。CRIS 主要是一种容量机制。通过允许请求使用更广泛的计算资源池,而非局限于某个区域的可用容量,它能提升吞吐量,并在负载下保持性能稳定。地理推理配置文件会在单一地理区域内路由请求,使您在扩展时仍能保持数据在该地理区域内处理。对于 GPT-5.6,此次发布引入了美国地理(US 跨区域推理)和全球 CRIS。全球推理配置文件会根据实时容量,将请求路由到模型部署的所有支持的 AWS 商业区域,为您提供广泛的 Amazon Bedrock 容量访问。

在本文中,我们将概述 Amazon Bedrock 上的 GPT-5.6 模型,介绍这些模型如何实现地理和全球跨区域推理,以及如何通过 Amazon Bedrock 控制台和代码调用这些模型,使用 OpenAI Responses API、OpenAI Chat Completions API 和 Amazon Bedrock Converse API。

Amazon Bedrock 上的 GPT-5.6

Amazon Bedrock 上的 GPT-5.6 系列包括通用型和专门用于网络安全的变体。本文涵盖支持跨区域推理的三种通用型变体:Sol、Terra 和 Luna。这三种变体均可接受文本和图像输入并返回文本,具有 100 万个 token 的上下文窗口,支持推理模式、服务器端工具调用和提示缓存。您可以通过 OpenAI Responses API、OpenAI Chat Completions API 和 Amazon Bedrock Converse API 调用它们。流式传输通过 Responses 和 Chat Completions API(stream=True)以及 ConverseStream 支持。

Amazon Bedrock 推理配置文件是您传递的逻辑标识符,而不是原始模型 ID。

  • 地理推理配置文件(以地理代码前缀,例如 us.,如 us.openai.gpt-5.6-terra)会将推理处理限制在预定义地理区域内的区域。请求通过您的源区域进入,只能路由到该地理区域内的目标区域,因此具有数据驻留要求的工作负载可以在跨区域扩展时仍保持在边界内。
  • 全球推理配置文件(以 global. 前缀,如 global.openai.gpt-5.6-terra)可根据实时容量将请求路由到模型部署的任何支持的商业 AWS 区域。它提供最广泛的容量池,适用于没有地理处理要求的工作负载。

计费和配额消耗是根据您的账户进行跟踪的,无论请求由哪个后端区域处理,因此仍适用统一的支出和吞吐量视图。通过全球CRIS处理的数据可能会跨越该模型合格区域集中的多个区域。如果您的工作负载有数据驻留要求,限制处理到特定地理区域,请使用该地理区域的地理配置(例如 us.openai.gpt-5.6-terra)或直接调用某个区域,而不是使用全球配置。Amazon Bedrock跨区域推理文档列出了每个模型的全球和地理配置集参与的区域。

下表列出了您可以调用GPT-5.6推理配置的源区域,以及您的请求可以被处理的目标区域。相同的路由规则适用于所有三个变体:Sol、Terra和Luna。

美国跨区域推理配置(us.openai.gpt-5.6-sol / -terra / -luna)

源区域

目标区域

美国东部(弗吉尼亚北部)us-east-1

美国东部(弗吉尼亚北部)us-east-1、美国西部(俄勒冈)us-west-2、美国东部(俄亥俄)us-east-2

美国西部(俄勒冈)us-west-2

美国东部(俄亥俄)us-east-2

美国西部(加州北部)us-west-1

美国东部(弗吉尼亚北部)us-east-1、美国西部(俄勒冈)us-west-2、美国东部(俄亥俄)us-east-2、美国西部(加州北部)us-west-1

加拿大(中部)ca-central-1

美国东部(弗吉尼亚北部)us-east-1、美国西部(俄勒冈)us-west-2、美国东部(俄亥俄)us-east-2、加拿大(中部)ca-central-1

加拿大西部(卡尔加里)ca-west-1

美国东部(弗吉尼亚北部)us-east-1、美国西部(俄勒冈)us-west-2、美国东部(俄亥俄)us-east-2、加拿大西部(卡尔加里)ca-west-1

全球跨区域推理配置(global.openai.gpt-5.6-sol / -terra / -luna)

源区域

美国:美国东部(弗吉尼亚北部)us-east-1、美国东部(俄亥俄)us-east-2、美国西部(俄勒冈)us-west-2、美国西部(加州北部)us-west-1

加拿大:加拿大(中部)ca-central-1

欧洲:欧洲(斯德哥尔摩)eu-north-1、欧洲(巴黎)eu-west-3、欧洲(都柏林)eu-west-1、欧洲(法兰克福)eu-central-1、欧洲(西班牙)eu-south-2、欧洲(米兰)eu-south-1、欧洲(伦敦)eu-west-2、欧洲(苏黎世)eu-central-2

亚太地区:亚太(墨尔本)ap-southeast-4、亚太(悉尼)ap-southeast-2、亚太(东京)ap-northeast-1、亚太(大阪)ap-northeast-3、亚太(首尔)ap-northeast-2、亚太(孟买)ap-south-1、亚太(海得拉巴)ap-south-2、亚太(新加坡)ap-southeast-1、亚太(雅加达)ap-southeast-3、亚太(泰国)ap-southeast-7、亚太(马来西亚)ap-southeast-5、亚太(台北)ap-east-2

中东:中东(阿联酋)me-central-1、以色列(特拉维夫)il-central-1

南美洲:南美洲(圣保罗)sa-east-1

全球支持的AWS商业区域路由

在Amazon Bedrock控制台中试用GPT-5.6

在Amazon Bedrock控制台中使用文本游乐场是试用GPT-5.6最快捷的方式,无需编码或SDK设置。您可以发送提示,调整推理参数,并在不同变体之间切换,以感受每个模型的特点,然后再集成API。模型选择器同时列出地理配置和全球跨区域推理配置,因此您可以在编写代码前测试任一跨区域推理选项。在上图中,源区域是美国东部(弗吉尼亚北部)。模型选择器中的“美国”条目对应地理推理配置,“全球”条目对应全球推理配置。

  • 在模型可用的区域(例如美国东部(北弗吉尼亚))中打开Amazon Bedrock控制台。
  • 在导航窗格中,选择“测试”下的“Playground”。
  • 在页面中间选择“选择模型”。
  • 搜索“OpenAI GPT-5.6 Sol”,选择“US OpenAI GPT-5.6 Sol”或“Global OpenAI GPT-5.6 Sol”,然后选择“应用”。
  • 输入提示信息并选择“运行”以生成响应。

图1:在Amazon Bedrock控制台模型选择器中选择美国或全球GPT-5.6推理配置文件

开始使用API

GPT-5.6在Amazon Bedrock上原生支持OpenAI响应API格式。如果您的应用程序已经调用OpenAI模型,可以将现有的OpenAI SDK客户端指向Amazon Bedrock的OpenAI兼容端点。然后将推理配置文件ID(全球或地理区域)作为模型参数进行替换。对于身份验证,Amazon Bedrock接受标准AWS凭证或Amazon Bedrock API密钥。API密钥路径对OpenAI SDK来说是最直接的适配方式,SDK会将其作为承载令牌传递。在生产环境中,建议使用aws-bedrock-token-generator包以编程方式生成短期API密钥,该包会从现有的AWS凭证(长期密钥仅推荐用于探索)派生承载令牌。

code
from aws_bedrock_token_generator import provide_token
from openai import OpenAI
region = "us-east-1"
# 将OpenAI SDK指向Amazon Bedrock的OpenAI兼容端点。provide_token()会从当前AWS凭证生成短期Amazon Bedrock API密钥(最长有效期为12小时),因此无需存储静态密钥。
client = OpenAI(
    base_url= f"https://bedrock-runtime.{region}.amazonaws.com/openai/v1",
    api_key=provide_token(region=region),
)

# 使用全球推理配置文件ID调用GPT-5.6 Terra。
model_id = "global.openai.gpt-5.6-terra"
response = client.responses.create(
    model=model_id,
    input="用两句话总结水平扩展和垂直扩展之间的区别。",
     max_output_tokens=512,
)

print(response.output_text)

有关支持参数的完整列表,请参阅《Amazon Bedrock用户指南》中的OpenAI GPT模型参数页面。相同的客户端也适用于Chat Completions API,如果您的应用程序已经使用此格式会很有帮助。

code
response = client.chat.completions.create(
     # 对于美国地理区域CRIS,使用"us.openai.gpt-5.6-terra"。
     # 其他变体:gpt-5.6-sol, gpt-5.6-luna
     model="global.openai.gpt-5.6-terra",
     messages=[
         {
             "role": "user",
             "content": "用一句话说明Amazon Bedrock中的跨区域推理是什么?",
         }
     ],
     max_completion_tokens=2000,
     reasoning_effort="low",
 )

print(response.choices[0].message.content)

如果您直接调用Amazon Bedrock而不是通过OpenAI SDK,请使用Amazon Bedrock Converse API,该API提供了与Bedrock上其他模型相同的请求结构:

code
import boto3

client = boto3.client("bedrock-runtime", region_name="us-east-1")

model_id = "global.openai.gpt-5.6-terra"
 response = client.converse(
     modelId=model_id,
     messages=[{"role": "user", "content": [{"text": "列出消息队列的三个常见用途。"}]}],
     inferenceConfig={"maxTokens": 512},
 )
 print(response["output"]["message"]["content"][0]["text"])

对于流式响应,请使用converse_stream并传入相同参数,然后遍历事件流:

code
stream_response = client.converse_stream(
     modelId=model_id,
     messages=[{"role": "user", "content": [{"text": "列出消息队列的三个常见用途。"}]}],
     inferenceConfig={"maxTokens": 512},
 )

for event in stream_response["stream"]:
     if "contentBlockDelta" in event:
         print(event["contentBlockDelta"]["delta"]["text"], end="")

安全与合规

跨区域推理使用与直接区域调用相同的 Amazon Bedrock 安全模型。请求通过您的 AWS 身份和访问管理 (IAM) 凭据进行身份验证,IAM 策略控制角色可以调用的推理配置文件。Amazon Bedrock 在芯片层面强制实施零操作员访问 (ZOA) 安全模型,因此没有任何 AWS 操作员可以访问您的提示或完成内容。每个模型调用都在您的 IAM 策略下运行,可以通过 VPC 端点从您的虚拟私有云 (VPC) 私密访问,并在 AWS CloudTrail 中记录。数据边界策略有助于防止数据在账户和网络边界之间被泄露。

对于某些模型(包括 GPT-5.6),被 Amazon Bedrock 自动滥用检测分类器标记的内容最多保留 30 天用于离线滥用检测。要查看此策略适用的模型以及其工作原理,请参阅《Amazon Bedrock 用户指南》中的“滥用检测”部分。如需了解 Bedrock 的数据保留配置,请参阅《Amazon Bedrock 数据保留文档》。如需查看每个配置文件路由集的权威区域列表,请参阅《Amazon Bedrock 跨区域推理支持页面》。

跨区域推理请求会显示在源区域的 AWS CloudTrail 中,附加事件数据中的 inferenceRegion 字段会记录处理每个请求的区域。如果启用了模型调用日志记录,请求和响应负载将被发送到同一账户和区域的 Amazon Simple Storage Service (Amazon S3) 或 Amazon CloudWatch Logs。

为跨区域推理设置 IAM 权限

要允许角色通过推理配置文件调用 GPT-5.6,需授予其对配置文件以及配置文件可路由到的每个区域中的基础模型的访问权限。您可以使用托管策略 AmazonBedrockLimitedAccess 或创建自定义策略。

对于地理推理配置文件,策略包含三个声明。第一个声明授予对源区域中的地理推理配置文件和默认项目的访问权限。第二个声明授予对源区域和地理区域内所有目标区域中的基础模型的访问权限,并包含一个限制条件,将此访问权限限制为通过该配置文件发起的请求。第三个声明授予 OpenAI 兼容 API 使用的 bearer-token 身份验证权限。

code
{ 
  "Version": "2012-10-17", 
  "Statement": [ 
    { 
      "Sid": "GrantGeoCrisProfileAndProjectAccess", 
      "Effect": "Allow", 
      "Action": ["bedrock:InvokeModel"], 
      "Resource": [ 
        "arn:aws:bedrock:<SOURCE REGION>:<ACCOUNT>:inference-profile/us.openai.gpt-5.6-terra", 
        "arn:aws:bedrock:<SOURCE REGION>:<ACCOUNT>:project/default" 
      ] 
    }, 
    { 
      "Sid": "GrantGeoCrisDestinationModelAccess", 
      "Effect": "Allow", 
      "Action": ["bedrock:InvokeModel"], 
      "Resource": [ 
        "arn:aws:bedrock:us-east-1::foundation-model/openai.gpt-5.6-terra", 
        "arn:aws:bedrock:us-east-2::foundation-model/openai.gpt-5.6-terra", 
        "arn:aws:bedrock:us-west-2::foundation-model/openai.gpt-5.6-terra" 
      ], 
      "Condition": { 
        "StringLike": { 
          "bedrock:InferenceProfileArn": "arn:aws:bedrock:<SOURCE REGION>:<ACCOUNT>:inference-profile/us.openai.gpt-5.6-terra" 
        } 
      } 
    }, 
    { 
      "Sid": "AllowBearerTokenAuth", 
      "Effect": "Allow", 
      "Action": ["bedrock:CallWithBearerToken"], 
      "Resource": "*" 
    } 
  ] 
}

全局推理配置文件使用包含四部分的策略。第一部分授权访问源区域中的全局推理配置文件和默认项目。第二部分授权访问源区域的基础模型。第三部分通过与区域无关的全局ARN授权访问基础模型,这正是实现跨区域路由的关键。第四部分授权OpenAI兼容API使用的Bearer Token认证。

code
{ 
 "Version": "2012-10-17", 
 "Statement": [ 
   { 
     "Sid": "GrantGlobalCrisProfileAndProjectAccess", 
     "Effect": "Allow", 
     "Action": ["bedrock:InvokeModel"], 
     "Resource": [ 
       "arn:aws:bedrock:<REQUESTING REGION>:<ACCOUNT>:inference-profile/global.openai.gpt-5.6-terra", 
       "arn:aws:bedrock:<REQUESTING REGION>:<ACCOUNT>:project/default" 
     ], 
     "Condition": { 
       "StringEquals": { "aws:RequestedRegion": "<REQUESTING REGION>" } 
     } 
   }, 
   { 
     "Sid": "GrantGlobalCrisInRegionModelAccess", 
     "Effect": "Allow", 
     "Action": ["bedrock:InvokeModel"], 
     "Resource": ["arn:aws:bedrock:<REQUESTING REGION>::foundation-model/openai.gpt-5.6-terra"], 
     "Condition": { 
       "StringEquals": { 
         "aws:RequestedRegion": "<REQUESTING REGION>", 
         "bedrock:InferenceProfileArn": "arn:aws:bedrock:<REQUESTING REGION>:<ACCOUNT>:inference-profile/global.openai.gpt-5.6-terra" 
       } 
     } 
   }, 
   { 
     "Sid": "GrantGlobalCrisGlobalModelAccess", 
     "Effect": "Allow", 
     "Action": ["bedrock:InvokeModel"], 
     "Resource": ["arn:aws:bedrock:::foundation-model/openai.gpt-5.6-terra"], 
     "Condition": { 
       "StringEquals": { 
         "aws:RequestedRegion": "unspecified", 
         "bedrock:InferenceProfileArn": "arn:aws:bedrock:<REQUESTING REGION>:<ACCOUNT>:inference-profile/global.openai.gpt-5.6-terra" 
       } 
     } 
   }, 
   { 
     "Sid": "AllowBearerTokenAuth", 
     "Effect": "Allow", 
     "Action": ["bedrock:CallWithBearerToken"], 
     "Resource": "*" 
   } 
 ] 
}

这些策略为 project/default 资源授予 bedrock:CallWithBearerToken 和 bedrock:InvokeModel 权限,OpenAI 响应和聊天完成 API 使用这些权限通过 Amazon Bedrock API 密钥进行身份验证并运行推理。如果使用流式 Converse API(ConverseStream),请将 bedrock:InvokeModelWithResponseStream 添加到推理配置文件和基础模型语句中。

这些语句相互配合,因此删除其中一条语句会阻止该角色的跨区域访问权限,这也为您提供了一种干净的方式来关闭特定角色的相应功能。或者,您可以附加一个明确的拒绝语句,针对 global. 或 us. 推理配置文件。

全局跨区域推理的服务控制策略考量

如果您的组织使用了区域限制型服务控制策略(SCPs),全局 CRIS 请求会将 aws:RequestedRegion 设置为未指定,而不是特定区域名称。地理 CRIS 请求会针对配置文件中每个目标区域进行评估。推荐的方法是使用 bedrock:InferenceProfileArn 条件来豁免跨区域推理,而不是扩大区域白名单。Amazon Bedrock 在授权基础模型时会设置该条件键,因此您可以在保持其他所有服务的白名单严格限制的同时,允许 CRIS 路由。您的源区域仍需在白名单中。如果您不想使用该条件,也可以将目标区域和未指定添加到白名单中,但这样会将这些区域开放给所有服务,而不仅仅是 Amazon Bedrock。如需现成的 SCP 和逐步指导,请参阅 Bedrock CRIS 区域控制 SCP 示例。

以下 SCP 拒绝在批准区域(悉尼和北弗吉尼亚)以外的 Amazon Bedrock 推理请求,并豁免 GPT-5.6 使用的 us. 和 global. 推理配置文件。第一条语句确保其他所有服务的区域白名单得到执行,因此请在 NotAction 列表中包含组织使用的全局服务。

code
{
  "Version": "2012-10-17",
  "Statement": [
    {
      "Sid": "DenyOutsideApprovedRegionsExceptBedrockInvoke",
      "Effect": "Deny",
      "NotAction": [
        "iam:*", "sts:*", "organizations:*", "account:*",
        "route53:*", "cloudfront:*", "waf:*", "wafv2:*", "shield:*",
        "support:*", "trustedadvisor:*", "health:*",
        "budgets:*", "ce:*", "cur:*", "tax:*", "billing:*",
        "bedrock:Invoke*"
      ],
      "Resource": "*",
      "Condition": {
        "StringNotEquals": { "aws:RequestedRegion": ["ap-southeast-2", "us-east-1"] }
      }
    },
    {
      "Sid": "DenyBedrockInferenceOutsideApprovedRegionsUnlessCris",
      "Effect": "Deny",
      "Action": [
        "bedrock:Invoke*"
      ],
      "Resource": "*",
      "Condition": {
        "StringNotEquals": { "aws:RequestedRegion": ["ap-southeast-2", "us-east-1"] },
        "ArnNotLike": {
          "bedrock:InferenceProfileArn": [
            "arn:aws:bedrock:*:*:inference-profile/us.*",
            "arn:aws:bedrock:*:*:inference-profile/global.*"
          ]
        }
      }
    }
  ]
}

两种配置文件类型都需要在账户和区域中启用模型访问权限。如需完整的检查清单,请参阅 推理配置文件的先决条件。

与提示缓存配合使用

GPT-5.6 的所有三个变体均支持在 bedrock-runtime 端点上使用提示缓存。当请求共享一个长提示前缀(如系统提示或一组少样本示例)时,Amazon Bedrock 会缓存该前缀。后续请求将复用已缓存的前缀,而不再重新处理。这会降低缓存部分的输入成本和延迟。

GPT-5.6 在 Amazon Bedrock 上支持两种缓存模式。隐式缓存是默认模式:服务会在最新用户或工具消息处设置缓存断点,这种模式适合通过追加消息扩展的对话。如果请求包含一个稳定的前缀,后接每次请求都会变化的内容,您可以使用显式缓存断点标记稳定内容的结束位置。在两种模式下,都需传递可选的 prompt_cache_key 参数,以确保相同前缀的请求路由到相同的缓存。两种模式均支持地理和全局推理配置文件。每个缓存断点需要至少 1,024 个 token 的提示前缀。更多信息请参阅 提示缓存加速模型推理

提示缓存也会影响配额使用。缓存读取的 token 不计入您的 TPM 配额,因此复用缓存前缀的请求会消耗更少的配额。下一节将描述配额的计算方式。以下示例使用了显式提示缓存,其中 client 和 model_id 来自“入门”部分:

python
# support_policy_manual 是跨请求共享的长稳定前缀
# 断点标记稳定内容的结束位置;断点后的用户问题在每次请求时变化,但不会使缓存前缀失效
completion = client.chat.completions.create(
     model=model_id,
     messages=[
         {
             "role": "system",
             "content": [
                 {
                     "type": "text",
                     "text": support_policy_manual,
                     "prompt_cache_breakpoint": {"mode": "explicit"},
                 }
             ],
         },
         {"role": "user", "content": "A customer wants a refund for a damaged laptop. What must I verify first?"},
     ],
     max_completion_tokens=300,
     prompt_cache_key="support-policy-v1",
 )

要确认缓存是否生效,请检查每个响应的使用情况对象:

python
details = completion.usage.prompt_tokens_details
print("Cached tokens:", details.cached_tokens)
print("Written tokens:", details.cache_write_tokens)

配额管理

GPT-5.6 的按需配额以每分钟 token 数(TPM)进行管理,并与您调用的推理配置文件关联:同一模型的地理配置文件和全局配置文件具有独立的配额分配,因此在它们之间切换会改变您使用的配额池。要查看当前配额或申请增加配额,请在 AWS 服务配额控制台中搜索 GPT-5.6 模型推理配额,从您的应用调用 Amazon Bedrock 的区域进行操作。

在申请增加配额时,请考虑消耗速率:输入和输出 token 转换为配额使用率的速率。输入 token 按 1:1 比例计入配额,而输出 token 的消耗比例更高。对于 GPT-5.6 模型,输出 token 的消耗速率为 10 倍,即一个输出 token 会消耗 10 个 TPM 配额 token,因此以输出为主的任务会比原始 token 数量更快消耗配额。每请求的计算公式为:

code
输入令牌数 + 缓存写入输入令牌数 + (输出令牌数 × 消耗率)

例如,一个包含 2,000 个输入令牌和 1,000 个输出令牌的请求会消耗您配额中的 12,000 个令牌。缓存读取令牌不计入此计算,这也是为什么提示缓存(前一节)对配额管理和成本控制如此有效。有关当前各模型的消耗率,请参阅 Amazon Bedrock 配额页面。以下三种实践有助于避免意外情况:

  • 在部署前申请配额增加。如果预计使用量较高,请在产品发布前通过 Service Quotas 控制台提前申请配额增加,而不是在生产环境中因限流问题才临时处理。
  • 监控使用情况。Amazon CloudWatch 会按推理配置文件实时发布配额使用率指标,因此您可以在使用量接近阈值时设置警报,并通过分析历史模式来规划未来的配额增加。
  • 在将工作负载提交到生产环境之前,使用真实流量(包括峰值模式和生产规模的提示)进行负载测试,并验证实际使用的配置文件类型,因为地理区域配额和全球配额是分开的。

监控与日志记录

由于 GPT-5.6 请求通过 Bedrock Runtime API 运行,通过地理区域或全球推理配置文件发出的请求会以与按需请求相同的方式显示在 Amazon Bedrock 模型调用日志中,请求和响应负载会与推理配置文件 ARN 一起记录(具体取决于您的日志配置)。您可以将调用日志发送到 Amazon S3 或 Amazon CloudWatch Logs。无论使用哪种配置文件类型,调用日志和指标都会记录在您的源区域,因此即使请求在其他区域处理,您的可观测性数据仍保留在同一位置。

Amazon CloudWatch 按推理配置文件发布涵盖调用次数、令牌数量、延迟、限流和错误的指标。由于地理区域和全球配置文件是不同的资源,它们的指标会分别报告。请求的延迟会根据请求落地的目标区域略有不同,因此如果当前仪表板按区域划分指标,请考虑添加一个按推理配置文件 ID 聚合的视图,因为这是应用程序代码和配额消耗所关联的 ID。使用情况也会在 AWS Cost Explorer 和 AWS 成本和使用情况报告中详细列出,因此您可以像处理其他 Bedrock 工作负载一样,按模型和配置文件类型归因 GPT-5.6 的支出。

结论

GPT-5.6 将三种 OpenAI 模型变体引入 Amazon Bedrock。通过此次发布,您可以通过两种跨区域推理配置文件调用每种模型。当推理处理需要保留在特定地理区域(在区域内跨区域扩展)时,您可以使用地理区域配置文件;当您希望在支持的商业 AWS 区域中获得最大容量池时,可以使用全球配置文件。无论哪种方式,您的应用程序只需通过一个端点与一个配置文件 ID 通信,日志、配额和计费信息会保留在您的源区域。这些模型支持 OpenAI Chat Completions API 和 Responses API(包括流式传输),以及 Amazon Bedrock Converse API。

要开始使用,请打开 Amazon Bedrock 控制台,通过推理配置文件向 GPT-5.6 Sol、Terra 或 Luna 发送测试提示,或通过 Responses API 以编程方式调用模型。在规划生产工作负载之前,请查看 Amazon Bedrock 定价页面了解当前 GPT-5.6 的计费标准。如果您的应用需要长上下文(100万 token)处理,请查看 Amazon Bedrock 按区域划分的模型支持页面,确认目标区域是否支持相关模型。

关于作者

'“