AWS Machine Learning Blog

Launching UI for generative AI inference recommendations in Amazon SageMaker AI

6.9内容质量
Launching UI for generative AI inference recommendations in Amazon SageMaker AI

TL;DR · AI 摘要

Launching UI for generative AI inference recommendations in Amazon SageMaker AI Artificial Intelligence Launching UI for...

核心要点

  • 主题聚焦:Launching UI for generative AI inference recomme
  • 来源:AWS Machine Learning Blog,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#后端#安全#产品
打开原文

在 Amazon SageMaker AI 中推出生成式 AI 推理推荐的 UI | 人工智能

在 Amazon SageMaker AI 中推出生成式 AI 推理推荐的 UI

将生成式 AI 模型部署到生产环境需要找到实例类型、带有设置的服务容器和优化策略的正确组合。这一过程通常需要经历漫长的优化和手动基准测试迭代周期。2026 年 4 月,Amazon SageMaker AI 推出了推理推荐功能,使客户能够通过 API 以数据驱动的方式获取生产就绪的配置。此功能可将常见工作负载的周期压缩到几分钟内,而自定义工作负载则只需数小时。

在本文中,我们将介绍 Amazon SageMaker AI Studio 中优化生成式 AI 推理推荐的 UI,这是一个低代码无代码(LCNC)体验。虽然 API 已经提供了对推荐的编程访问,但它假设您知道需要设置哪些参数以及如何解释原始基准测试结果。UI 消除了这一假设。它通过预设使用案例配置文件、结果的可视化比较和一键部署功能进行引导,使没有深厚基础设施专业知识的团队也能自主获得经过验证的配置。

随着此次发布,您可以配置优化任务并选择预设使用案例配置文件。您可以比较性能结果并将推荐的配置部署到生产端点,无需编写任何一行代码。高级用户仍可使用 API 进行细粒度配置。

机器学习(ML)工程师可以在技术领导者评估成本性能权衡的同时验证下一个部署。在这两种情况下,Studio 的体验都加快了从模型选择到生产就绪配置的路径。

新 Studio 体验概述

Amazon SageMaker AI Studio 现在在 Jobs > 推理优化 下包含生成式 AI 推理推荐的 UI。它提供了一个引导式的端到端工作流程,逐步引导您完成工作负载配置、优化、模型选择和部署。

预设使用案例配置文件

工作流程从定义工作负载配置开始。您无需手动指定令牌分布和并发性,而是可以选择一个预设使用案例配置文件,该配置文件捕捉了常见的流量模式。Interact 配置文件适用于具有短输入和中等输出的聊天式工作负载。Generate 针对需要更长输出的内容生成进行了优化,而 Summarize 则针对文档摘要的高输入到输出比例进行了优化。如果这些配置文件均不符合您的工作负载,您可以使用 Custom 配置文件导入自己的数据集,并自行设置并发性、令牌长度和评估数据。所选配置文件会设置基准参数,因此您无需直接考虑这些参数。

优化目标

在选择使用案例配置文件的同时,选择一个优化目标,告诉 SageMaker AI 需要优先考虑的内容。最小化延迟 会针对最低可能的响应时间进行优化,适用于用户等待每个令牌的交互式应用。最大化吞吐量 会以每秒处理最大数量的令牌为目标,更适合批量或高流量工作负载。最小化成本 会找到针对您预期流量最经济高效的配置。您选择的目标将影响 SageMaker AI 应用的技术手段以及对推荐结果的排序方式。

支持的模型来源

现在,您需要选择需要进行推理优化的模型。UI 会根据模型当前所在的位置进行适配。您可以从 Amazon SageMaker JumpStart 目录中拉取一个基础模型(FM),该目录提供多种预训练模型。或者,您可以指向 Amazon Simple Storage Service(Amazon S3)上的自有模型文件,复用模型注册表中的已注册包,或选择之前部署或训练作业中已存在的 SageMaker 模型。

操作指南:通过控制台获取建议

在以下章节中,我们将逐步演示从创建作业到部署最佳配置的完整流程。每个步骤都基于前一步骤,因此首次阅读时请按顺序阅读,后续运行时可直接跳转到所需步骤。

#### 先决条件:

要跟随本指南操作,您必须具备以下条件:

  • 包含 Amazon SageMaker AI Studio 域的 AWS 账户。
  • 用于 Amazon SageMaker AI 推理优化操作的 AWS Identity and Access Management(IAM)权限。
  • 具有访问 Amazon S3 中模型文件的 IAM 执行角色。

定价:生成建议不产生额外费用。优化作业和基准测试期间部署的端点将适用标准计算费用。

步骤 1:创建优化作业

在 Studio 左侧导航栏中,选择 Jobs,然后选择 Inference optimization。接着选择 Create(或 Optimize inference)。创建作业后,下一步是告诉 SageMaker AI 您要优化的目标。

图 1:显示现有作业的推理优化首页

步骤 2:配置策略

每个业务用例都有不同的需求:有些对延迟预算要求非常严格,而有些则对成本预算有严格限制。根据您的用例,选择一个用例配置文件(InteractGenerateSummarizeCustom)和一个优化目标(Minimize costMinimize latencyMaximize throughput)。

图 2a:策略配置界面显示用例预设(Generate、Interact、Summarize、Custom)和优化目标

如果您选择 Custom,将出现额外字段。您可以粘贴 JSONL 格式的评估数据集的 S3 URI,指定用于模拟并发的请求数量,并设置最大输出令牌长度。

图 2b:自定义工作流显示数据集路径、并发数和输出令牌

步骤 3:选择模型和计算资源

Model 部分使用 Select 按钮选择所需模型。将出现一个窗口,包含每个模型来源的标签页。

图 3a:模型选择弹窗显示 JumpStart 标签页,包含 JumpStart、S3、Logged 和 Deployable 的标签

如果选择 S3,您需要提供模型名称和模型文件的 S3 URI 路径。

图 3b:模型选择弹窗显示 S3 标签页,包含 JumpStart、S3、Logged 和 Deployable 的标签

选择模型后,您可以让 SageMaker AI 自动选择硬件,或缩小到特定实例类型。

选择计算资源是可选操作。

在步骤 2 中,如果您选择“最小化延迟”或“最大化吞吐量”作为优化目标,可以展开“计算”部分以指定实例类型。从那里选择特定的实例类型(例如 ml.g6e.2xl 或 g7e.2xl)供任务评估。如果不指定,SageMaker AI 会根据您的模型需求选择兼容的实例。如果您通过灵活训练计划预留了容量,可以在“来源”列表中看到这些预留资源。

注意:对于“最小化成本”用例,SageMaker AI 会自动选择推荐的实例类型。

图3c:计算部分显示为推荐任务选择了三种实例类型进行评估

您的配置现已完成,可以启动任务并查看其运行情况。

步骤 4:启动和监控

选择“优化”以提交任务。您将进入任务详情页面,可以在此页面上查看状态从“运行中”变为“已完成”。像“交互”这样的预设用例可以快速返回推荐结果,因为它们匹配预验证的配置;而自定义基准测试可能需要更长时间,具体取决于模型大小、实例类型和数据集。要停止正在运行的任务,请使用“操作”菜单。

图4:运行中的优化任务显示“操作”按钮、“设置”标签页和状态

使用详情页面的标签页检查您的任务。“概览”标签页显示按性能指标排序的推荐结果,这些指标在任务完成后显示。“设置”标签页显示您提交的配置,包括用例、目标和计算选择。“详情”标签页包含任务元数据、时间戳和输出工件。

步骤 5:查看推荐结果并部署

“概览”标签页显示按优先级排序的推理包。每个包显示优化后的配置、性能指标(首次生成令牌时间(TTFT)、令牌间延迟(ITL)、吞吐量和成本),以及“部署”按钮。

图5:完成的任务显示带有“部署”按钮的优化推理包

在您首选的包上选择“部署”。一个窗口会预填充端点名称和实例类型。您可以部署到新端点或更新现有端点。SageMaker AI 随后依次执行三个步骤:注册优化后的模型、设置端点配置、分配端点。端点达到“已就绪”状态后,您可以立即调用它。

管理优化任务

“任务”和“推理优化”首页为您提供优化任务的集中管理。您可以使用搜索栏按名称筛选任务。要停止正在运行的任务,请选择任务,选择“操作”,然后选择“停止”并确认。要删除旧任务,请选择已完成或失败的任务,选择“操作”,然后选择“删除”并确认。您还可以选择任何任务查看其详情页面,详情页面包含“概览”、“设置”和“详情”标签页。

实现原理

控制台界面和 API 使用相同的推荐及基准测试基础设施。SageMaker AI 首先分析您的模型架构和内存需求,以缩小配置空间并识别可行选项。然后根据您选择的目标应用对齐优化:吞吐量目标使用推测解码,延迟目标使用内核调优。SageMaker AI 使用 NVIDIA AIPerf 在真实 GPU 基础设施上对每种配置进行基准测试,并使用多轮置信区间进行验证。最后,它根据优化目标对结果进行评分,并返回按从最佳到最差排序的生产就绪配置。

推理优化任务会根据您选择的优化目标运行多个步骤。若选择最小成本,SageMaker AI 会使用其推荐的实例类型创建端点,并对其运行基准测试任务。在任务运行期间,可通过打开“Deployments” > “Endpoints”查看“In Service”状态。要查看基准测试运行情况,请打开“Training” > “Training Jobs”,并选择您的任务。

若选择最小延迟,如果模型架构和实例类型支持,SageMaker AI 会使用经过调优的内核进行部署。否则,会创建一个或多个标准端点,每个端点对应一种实例类型。随后,SageMaker AI 会对每种组合以训练任务的形式运行基准测试。与其它目标一样,您可通过查看“Endpoints”和“Training logs”监控进度并排查问题。

若选择最大吞吐量,如果模型架构和实例类型支持推测解码,会先运行一个训练任务训练草稿模型,然后再部署端点。SageMaker AI 随后会对每种组合以训练任务的形式运行基准测试。与其它目标一样,您可通过查看“Endpoints”和“Training logs”监控进度并排查问题。

图6a:推理优化任务为第4步中选择的每个实例类型创建的In Service端点 图6b:为每个基准测试配置显示的In Progress训练任务

注意:优化任务完成后会自动删除创建的端点。

最佳实践

有几个最佳实践需要特别注意。在对模型进行微调或更新后,应重新运行优化任务。当AWS区域中出现新的实例类型、流量模式发生显著变化,或在服务容器或框架升级后,也应重新运行。此外,建议定期执行优化任务(例如每隔几周一次),因为Amazon SageMaker AI团队会持续添加新发现。

结论

Amazon SageMaker AI Studio中针对生成式AI推理推荐的控制台体验,使团队能够更便捷地做出数据驱动的基础设施决策。通过预设用例配置文件、引导式优化工作流程、可视化推荐对比以及一键部署功能,您可以更快地从模型选择过渡到针对工作负载验证的配置。

从在Amazon SageMaker AI Studio中创建第一个优化任务开始,查阅文档以获取详细指导。

相关资源

作者简介

'"`