AWS Machine Learning Blog

New agent skill: Amazon SageMaker optimized generative AI inference for your coding agent

8.5内容质量
New agent skill: Amazon SageMaker optimized generative AI inference for your coding agent

TL;DR · AI 摘要

AWS推出SageMaker优化生成式AI推理技能,可生成可执行代码提升部署效率,兼容主流编码代理。

核心要点

  • AWS SageMaker新技能生成可执行代码,提升部署效率
  • 兼容Kiro、Claude Code等主流编码代理
  • 通过Agent Toolkit 10分钟快速上手

结构提纲

按章节快速跳转。

  1. AWS推出SageMaker优化生成式AI推理技能,提升编码代理效率。

  2. 工程师常面临模型部署的复杂性,需平衡性能、成本与约束。

  3. 技能生成可执行代码,支持基准测试与配置推荐。

  4. 通过Agent Toolkit安装,10分钟完成配置。

  5. 适用于实时、批量和异步模式的模型部署优化。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AWS SageMaker生成式AI推理技能
    • 功能
      • 生成可执行代码
      • 基准测试推荐
    • 兼容代理
      • Kiro
      • Claude Code
      • Codex
    • 设置方式
      • Agent Toolkit安装
      • JupyterLab集成

金句 / Highlights

值得收藏与分享的关键句。

#AWS#SageMaker#生成式AI#编码代理#机器学习
打开原文

新增代理技能:为您的编码代理优化 Amazon SageMaker 生成式 AI 推理 | 人工智能

新增代理技能:为您的编码代理优化 Amazon SageMaker 生成式 AI 推理

工程师们越来越多地使用代码辅助工具来加速开发流程。今天,Amazon SageMaker AI 优化的生成式 AI 推理推出 aws-ai-ml 技能,该技能通过 AWS Agent Toolkit 提供。该技能赋予 Kiro、Claude Code 和 Codex 等编码代理在推理优化和基准测试方面的深度专业知识。安装该技能后,您现有的代理可以对端点进行基准测试、推荐部署配置、比较性能运行情况,并为您生成可执行的 SageMaker Python SDK v3 代码。aws-ai-ml 技能是一个工具包,可插入任何支持模型上下文协议(MCP)的编码代理,将其转变为 SageMaker AI 推理优化专家。

在本文中,我们将介绍该技能的功能、安装方法,以及它如何帮助您更快地从模型部署到生产环境。

挑战:弥合意图与基础设施之间的差距

Amazon SageMaker AI 支持实时、批量和异步模式的服务器端托管。它提供按需和预留容量、异构实例、虚拟私有云(VPC)隔离、自动扩展,以及与所有 SageMaker AI 训练路径的集成。其功能覆盖范围广泛且深入,但大多数工程师在开始时并不清楚哪种实例家族或服务容器最能满足需求。他们通常带着一个用例而来:希望达到的性能目标、需要遵守的成本限制,或在投入生产前需要评估的模型。

SageMaker AI 优化的生成式 AI 推理代理体验弥补了这一差距。您只需告诉代理想要完成的任务,它就会生成可执行的 SageMaker Python SDK v3 代码,您可以查看、修改并在自己的环境中运行。代理会提出有针对性的澄清问题,基于真实基准测试和性能数据生成代码,并像解决方案架构师一样适应您的业务约束条件。

在整个过程中,您始终掌握控制权。每一步都实时可见,并以您可以阅读和提问的代码形式表达。所有操作都不会在不透明的用户界面背后发生。

入门指南

您可以通过 AWS Agent Toolkit 在本地机器上安装 aws-ai-ml 技能,或在 Amazon SageMaker Studio JupyterLab 空间中使用它。无论哪种方式,您都可以在 10 分钟内从零开始进行对话。

选项 A:与任何编码代理配合使用(Kiro、Claude Code、Codex 或任何 MCP 兼容代理)

步骤 1:安装 AWS Agent Toolkit 如果尚未安装,请设置 AWS Agent Toolkit。这需要 AWS 命令行界面(AWS CLI)2.35+ 和 uv 工具。

bash
aws configure agent-toolkit

此命令会自动检测您的代理,安装技能并配置 AWS MCP 服务器。有关特定代理的设置(插件安装命令、MCP 配置),请参阅 AWS Agent Toolkit 入门指南。

步骤 2:安装 aws-ai-ml 技能 将 SageMaker AI 优化的生成式 AI 推理技能添加到您的代理中:

bash
npx skills add aws/agent-toolkit-for-aws/skills/aws-ai-ml

步骤 3:确认并开始。打开您的编码代理的聊天面板,询问:“有哪些可用技能?”您应该能看到 aws-ai-ml 被列出。确认后,用自然语言描述您的意图。现在您的编码代理已内置 SageMaker AI 推理优化专业知识。

前提条件:您的 AWS 凭证必须具有调用 SageMaker AI API 的权限(创建端点、运行基准测试和推荐任务)。该技能生成的代码将在您的凭证下运行。该技能本身不需要额外的 AWS 身份和访问管理(IAM)配置。

注意:对于 Kiro 和 Claude Code,代理可以在运行时发现技能。它们可以通过 AWS MCP Server 按需搜索并加载技能,无需本地安装。询问您的代理:“搜索与数据库相关的 AWS 技能。”有关运行时发现技能的详细信息,请参阅 readme 文件。

选项 B:在 Amazon SageMaker Studio 中使用

如果您更倾向于在托管的 JupyterLab 环境中工作,可以使用预配置镜像在 Amazon SageMaker Studio 中使用该技能。

步骤 1:打开 Amazon SageMaker Studio。在目标 AWS 账户和 AWS 区域中导航到 Amazon SageMaker Studio。选择您的 Studio 域并从用户个人资料中启动 Studio IDE。

步骤 2:创建 JupyterLab 空间。从 Studio 首页选择 JupyterLab,然后选择 创建 JupyterLab 空间。为该空间命名(例如 my-inference-opt),并将共享设置保留为 Private(技能仅在私有空间中同步)。在镜像菜单中,选择包含 SageMaker AI 优化生成式 AI 推理技能的镜像。该镜像预配置了 aws-ai-ml 代理技能和所有必要依赖项。选择运行空间并等待其启动(首次启动需要 5-10 分钟)。

注意:使用新的空间。如果使用了本地修改过技能版本的重复空间,可能无法加载预配置镜像。

步骤 3:打开 JupyterLab 并启动终端。空间启动后,打开 JupyterLab 并选择终端。

步骤 4:授权您的编码代理。在终端中,使用身份提供商凭据对编码代理进行身份验证。例如,使用 Kiro:

code
kiro-cli login --license pro --identity-provider <your-IdP-start-URL> --region us-east-1 --use-device-flow

步骤 5:确认并开始。打开您的编码代理的聊天面板,询问:“有哪些可用技能?”您应该能看到 aws-ai-ml 被列出。确认后,用自然语言描述您的意图。

故障排除:如果代理报告没有可用技能,请确认您的空间是否设置为 Private。您也可以从终端检查:

code
ls ~/.kiro/skills/

如果该目录为空但 /etc/sagemaker/skills/ 包含技能文件,请运行 restart-jupyter-server,刷新页面后重试。

您可以执行的操作

代理体验覆盖了推理优化生命周期中的以下功能。您不需要知道要调用哪个功能。描述您想要的内容,代理会自动判断下一步操作,或在信息不明确时提出澄清问题。

对现有端点进行基准测试

如果您已经在 SageMaker AI 端点上部署了模型,可以要求代理对其进行基准测试。告诉代理您要测试的端点,它将生成一个 Python 笔记本,使用 SageMaker Python SDK 中的 Workload.synthetic() 和 start_benchmark() API 运行负载测试。

在运行任何基准测试之前,代理会确认您的端点可以安全地进行负载测试,因为基准测试会将真实流量发送到正在运行的端点。

当基准测试完成后,您将获得一份定量性能报告,包括:

  • 吞吐量:每秒请求数、每秒输出令牌数。
  • 延迟:p50、p99、首次令牌时间、令牌间延迟。
  • 并发性:支持的并发请求数量。

这些是真实基础设施上真实负载的测量值,而非估算值。代理还会推荐改进机制(如预填充解码)以提升性能。

示例提示:“在SageMaker AI上对我的Llama端点进行基准测试。”

为您的模型选择合适的实例类型

如果您有模型并需要在SageMaker AI上找到合适的实例类型进行部署,请告诉您的代理。无论您的模型存储在哪里或如何获取,都可以处理:

  • 存储在Amazon Simple Storage Service(Amazon S3)中的微调或自定义模型:您训练或下载了模型并将其存储在S3中。提供S3 URI和优化目标。示例提示:“我想找到部署我的微调模型在SageMaker上最便宜的实例类型。”
  • 来自Amazon SageMaker JumpStart的公开基础模型:您想从JumpStart目录中部署一个基础模型(FM),然后提供模型ID。示例提示:“在SageMaker AI上为模型huggingface-reasoning-qwen3-8b找到最佳实例。”
  • 存储在Hugging Face Hub上的模型:您想使用Hugging Face上托管的模型。提供模型名称。对于受限制的模型(如Llama变体),您的代理会显示许可证条款并要求您接受并提供Hugging Face令牌。示例提示:“我想从Hugging Face Hub部署一个Llama模型。最便宜的选项是什么?”

在所有情况下,您的代理都会生成代码,评估您的模型与候选实例和配置的性能,然后呈现按性能指标排序的部署选项:吞吐量、延迟百分位数、首次令牌时间和并发性。您可以根据成本和性能需求进行选择。

比较基准测试运行

如果您运行了多个基准测试(例如配置更改前后或跨两种实例类型),可以要求代理进行比较。提供两个基准任务名称,代理会生成比较结果,计算关键指标的差异:吞吐量、延迟百分位数和首次令牌时间。

结果会以百分比变化显示,正数表示性能提升,从而为您提供一个简洁的总结,说明您的更改是否提升了性能、降低了性能或没有明显影响。

如果其中一个基准测试运行不存在,代理会先提供运行该测试的选项,然后再进行比较。

示例提示:“我有两个基准测试运行,想比较它们。哪个更快?”

基准测试结果

此表比较了在同一基准工作负载(512/256个令牌,并发数4)下部署的两个模型。Δ%列显示模型B(Qwen3-8B)在每个指标上比模型A(Qwen3-1.7B)快多少。正值表示模型B表现更好。

| 指标 | Qwen3-1.7B(模型A) | Qwen3-8B(模型B) | Δ% | |------|------------------|------------------|----| | 输出令牌吞吐量 | 188.2 tokens/s | 271.2 tokens/s | +44.1% ✅ | | 每用户吞吐量 | 47.5 tokens/s | 69.4 tokens/s | +45.9% ✅ | | 请求吞吐量 | 0.736 req/s | 1.08 req/s | +46.7% ✅ | | 令牌间延迟 | 20.9 ms | 14 ms | +33.0% ✅ | | 请求延迟 | 5,382 ms | 3,658 ms | +32.0% ✅ | | 首次令牌时间 | - | - | - |

67.5 毫秒

166.3 毫秒

−146.5% ❌

两个模型运行在不同硬件上。Qwen3-8B 使用 4-GPU ml.g5.12xlarge(4x A10G),而 Qwen3-1.7B 使用单个 L4 GPU(ml.g6.4xlarge)。差异反映了大约 4 倍的计算资源,而不仅仅是模型本身。

结论:Qwen3-8B 的吞吐量提高了约 44–47%,端到端延迟更低,这主要得益于额外的 GPU 计算能力。Qwen3-1.7B 仅在首次生成 token 的时间上占优,这符合小模型在单 GPU 上的预期优势。

综合应用

您无需记忆能力名称或了解应请求哪种工作流程。下表展示了常见请求与结果的对应关系。

您说

您得到

“我已经部署了模型,想了解它的速度。”

定量性能报告:来自真实负载的吞吐量、延迟百分位数和并发性指标。

“我在 S3 上有模型,但不知道该部署在哪种实例上。”

按成本、吞吐量和延迟排序的部署选项,每个候选配置均有说明。

“我想部署一个 JumpStart 模型并找到最便宜的实例,我只有模型 ID。”

无需 S3 中间存储的部署选项排序。如需,会提供受限制模型的替代方案。

“我在变更前后运行了基准测试,哪个更快?”

所有指标的百分比变化,显示改进或退化情况。

“我想优化来自 Hugging Face Hub 的 Llama 模型。”

显示许可证,将模型上传至 S3,然后输出标准推荐。

如果您的请求涉及多个功能(例如,先将 Hugging Face 模型上传至 S3,然后获取部署建议),代理会在同一对话中自然串联这些操作。

关于代理的预期表现

配备 aws-ai-ml 技能的代理遵循一些行为规范,使体验可预测且安全:

  • 它会明确请求所需信息。如果信息缺失(如端点名称或 S3 URI),代理会要求您提供,而不是猜测。
  • 在执行重大操作前会确认。在运行会向实时端点发送真实流量的基准测试前,代理会警告您可能的影响并要求明确确认。
  • 它会告知您超出范围的内容。如果请求了代理无法执行的操作(如部署模型),它会解释可提供的替代方案,例如生成您需要的部署配置。
  • 它会生成 SageMaker Python SDK v3 代码。所有输出均为可执行代码,您可以在自己的环境中查看、修改和运行。

清理资源

为避免持续收费,请删除创建的资源:

  • 删除基准测试或推荐过程中创建的 SageMaker AI 端点。
  • 如果使用了 SageMaker Studio,请停止或删除 JupyterLab 空间。
  • 删除 SageMaker AI 默认存储桶中由基准测试和推荐作业存储的 S3 对象。

结论

Amazon SageMaker AI 优化生成 AI 推理的 aws-ai-ml 技能,将您现有的代码代理转变为 SageMaker AI 推理优化专家。无论您需要对实时端点进行基准测试、为模型找到最便宜的实例、比较配置,还是为评估准备 Hugging Face 模型,只需描述您的需求,代理就会交付可衡量的结果。

要开始使用,请通过 AWS 的 Agent Toolkit 安装该技能,并将其添加到您正在使用的编码代理中,或在 Amazon SageMaker Studio 中启动预配置的 JupyterLab 环境。有关更多信息,请参阅 Amazon SageMaker AI 文档。

关于作者

'\"