AWS Machine Learning Blog

Context intelligence for your data and AI agents at scale

8.5内容质量
Context intelligence for your data and AI agents at scale

TL;DR · AI 摘要

AWS 推出 AWS Context 服务,通过知识图谱技术整合企业数据,提升 AI 代理的决策能力。

核心要点

  • AWS Context 通过知识图谱自动映射数据关系,提升 AI 代理的上下文理解能力。
  • AWS Context 与 Amazon Quick、AWS Glue Data Catalog 等工具集成,支持企业级治理。
  • AWS Context 使用 Apache Iceberg 格式发布数据,兼容多种工具,降低使用门槛。

结构提纲

按章节快速跳转。

  1. AI 代理的智能取决于其对上下文的理解,而上下文通常分散在多个数据源中。

  2. §AWS Context 服务介绍

    AWS Context 是一项新服务,通过知识图谱技术整合企业数据,提升 AI 代理的上下文理解能力。

  3. AWS Context 支持自动映射数据关系,并提供治理功能,确保 AI 代理访问的数据是可信的。

  4. AWS Context 与 Amazon QuickAWS Glue Data Catalog 等工具集成,支持企业级治理和权限管理。

  5. AWS Context 使用 Apache Iceberg 格式发布数据,兼容多种工具,降低使用门槛。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AWS Context
    • 功能
      • 知识图谱自动映射
      • 治理功能
    • 集成
      • Amazon Quick
      • AWS Glue Data Catalog
      • AWS Lake Formation
    • 数据格式
      • Apache Iceberg

金句 / Highlights

值得收藏与分享的关键句。

  • AWS Context 通过知识图谱技术整合企业数据,提升 AI 代理的上下文理解能力。

    第 2 段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • AWS Context 与 Amazon Quick、AWS Glue Data Catalog 等工具集成,支持企业级治理。

    第 3 段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • AWS Context 使用 Apache Iceberg 格式发布数据,兼容多种工具,降低使用门槛。

    第 4 段

    ⬇︎ 下载 PNG𝕏 分享到 X
#AWS#AI#知识图谱#数据治理
打开原文

为您的数据和 AI 代理提供可扩展的上下文智能 | 人工智能

为您的数据和 AI 代理提供可扩展的上下文智能

代理的智能程度取决于它们能够推理的上下文。目前,这些上下文分散在数据湖、数据仓库、湖仓一体架构、数据库和数据流中,还存在于从未被记录下来的机构知识中。您希望信任 AI 代理所做出的决策,但只有当代理拥有上下文时,这种信任才可能发生。想象一下,当代理能够安全地访问它们所需的上下文,从而做出可信赖的决策时,将有哪些可能性。

这就是为什么在 AWS Summit New York City 上,我们宣布了一系列创新,为您的数据和 AI 代理提供可扩展的上下文智能。

AWS Context(即将推出)

在今天的主题演讲中,我们介绍了 AWS Context,这是一个新服务,可以自动将您现有数据之间的关系映射到知识图谱中,并提供代理搜索功能,使组织中的 AI 代理能够在运行时访问受控的数据关系、业务规则和领域知识。数据管理员和策展人可以通过直观的控制台体验管理图谱,审查推断出的关系,将其推广到生产环境,并附加特定领域的知识,如业务定义和使用规则。

AWS Context 延伸了 Amazon Quick 使用的相同知识图谱技术,数以万计的用户每天与一个用于分类数据集、仪表板和元数据的生产知识图谱进行交互,通过使用模式学习,使每次交互更加智能。该图谱每天已经处理数百万次请求。借助 AWS Context,我们将个人知识图谱扩展为组织级的知识图谱,一个共享且受控的上下文层,组织中的代理和应用程序可以从中获取信息。现有的 Amazon Quick 用户将立即受益。当启用 AWS Context 后,Quick 的代理将能够访问更广泛的企业的知识图谱,包括跨系统的关系、业务规则和经过策展的上下文,这些内容是任何单个用户的个人图谱无法提供的。AWS Glue Data Catalog、Amazon SageMaker Unified Studio 和 AWS Lake Formation 都与知识图谱集成,因此团队可以通过业务规则和权限对其进行治理,并通过 AI 辅助或手动策展自动添加新的上下文。

上下文层的关键元素以 Apache Iceberg 格式发布到 Amazon S3,这样客户可以自由选择使用符合 Iceberg 标准的工具来消费元数据,并基于开放标准构建 AWS Context。无需提供基础设施或构建检索管道,客户只需在 AWS Management Console 中点击几次,即可开始收集和策展代理的上下文。

让我们更详细地了解其背后的功能。

从代理的工作方式中学习的上下文

随着代理越来越多地使用 AWS Context,它会变得越来越智能。当代理查询图谱时,它会观察哪些数据源产生了正确的结果,代理依赖哪些连接路径,以及哪些策展规则被应用。它根据实际使用情况对数据源进行排名,并在组织内分享所学到的内容,因此当一个代理发现正确的连接路径或解决模式歧义时,其他代理可以自动获取这些信息,而无需人工重新策展图谱。

设计上开放且可移植

AWS Context 将结构化和非结构化数据源中的所有关键元数据以 Apache Iceberg 格式发布到 Amazon S3 表中,这样您就可以使用 Amazon Athena、Amazon Redshift、Apache Spark 或任何 Iceberg 兼容引擎查询上下文,并在此基础上构建下游系统、进行审计或迁移。

AWS Context 还设计为能够连接第三方目录,因此您可以将非 AWS 系统中的上下文引入到同一个图中。无论代理是基于 Amazon Bedrock AgentCore 构建、部署在 Amazon EKS 上,还是运行在 MCP 兼容框架中,它们都可以通过代理搜索 API 和 MCP 工具进行查询。您的上下文始终保持可查询性,通过 Apache Iceberg 格式实现可移植性,并且完全属于您。

默认具备身份感知和治理能力

将任何代理投入生产都会引发治理问题:它能够访问哪些数据?您能否准确地展示它访问了哪些数据以及是在谁的授权下访问的?AWS Context 通过使每个查询都具备身份感知能力来回答这两个问题。每个调用都设计为继承调用用户的 IAM 和 Lake Formation 权限,因此代理只能看到并遍历其身份被授权访问的关系。由于访问是通过身份进行的,因此每次交互都可以审计。您的安全和合规团队可以使用您已经依赖的相同控制措施,验证代理访问了哪些数据以及是在谁的授权下访问的。

AWS Glue Data Catalog 业务上下文和语义搜索(预览版)

今天,我们还宣布了 AWS Glue Data Catalog 业务上下文和语义搜索的预览版本,为人类和 AI 代理提供上下文和工具,使他们更容易发现和理解数据。现在,客户可以丰富其 Glue 表、视图和列(包括那些由 S3 表支持的),包括添加业务描述、术语表术语、自定义元数据,并将它们与提供额外数据上下文的技能资产相关联,这些上下文存储在目录之外。通过将业务上下文与技术元数据一起索引在 Glue Data Catalog 中,客户可以使用新的 Glue Search API 更快速地通过业务含义查找数据,AI 代理可以基于可信定义进行推理,而不是推断上下文。

我们也很高兴在 Glue Data Catalog 中提供技能资产的预览版本。现在,数据生产者可以创建技能资产,这是一种新的资产类型,引用存储在任何位置(包括 S3、git 仓库和维基)中的文件(如 AI 技能、指南 Markdown 文件和团队运行手册)的 URI。将技能资产与数据资产相关联,可以为代理提供额外的上下文和指令,它们可以逐步检索这些信息,以便在处理特定数据时使用,而无需逐个提示重新教授每个代理。例如,技能 URI 位置可以指向您团队的仓库,其中包含特定领域的文档或流程,其中包括数据使用细节,如粒度和范围、常见的查询模式和最佳实践,以及使用规则(何时使用数据,连接键和必需的筛选条件是什么)。

技能资产使 AI 代理更容易在数据环境中找到合适的数据,但这只是问题的一半。代理还需要知道如何使用这些数据:在聚合数据之前应应用哪些过滤条件,应遵循哪些连接路径,以及技术模式中未显示的注意事项。目前,AWS Agent Toolkit 包含默认技能,帮助 AI 代理与 Glue Data Catalog 交互,并支持其他功能,如 Amazon Athena 和 S3 表。许多企业都有自己的技能,这些技能由其数据团队开发。要开始使用,开发人员可以使用远程、完全托管的 AWS MCP 连接任何兼容 MCP 的代理,以访问 AWS 服务技能,或者通过为 Claude Code、Cursor 和 Amazon Kiro 安装 aws-data-analytics 插件,让代理查找数据、进行分析,或基于这些数据构建应用程序,使用 AWS 或其他自定义技能。使用 AgentCore 工具构建的代理可以通过一行代码访问 AWS Agent Toolkit 中的所有 AWS 技能。这使得您的代理能够快速利用 AWS 服务的专业知识和最佳实践。

Amazon S3 注释(现已正式发布)

为了使客户更容易为其数据湖添加自定义上下文,我们宣布 Amazon S3 注释现已正式发布。这是一种新的方式,可以将丰富的、可查询的业务上下文直接附加到您的 S3 对象,并将该上下文存储在 S3 Iceberg 表中。长期以来,客户一直使用对象标签和用户定义的元数据来描述 S3 中的对象,这些工具仍然是用于访问控制等操作任务以及上传时设置的小块信息的正确工具。但随着客户在其数据之上构建代理,他们希望附加更多的元数据。他们希望创建和演化丰富的上下文,这些上下文可以被代理在大规模上读取和操作。S3 注释通过开放的数据格式提供了这种能力。存储在 S3 中的每个对象可以拥有高达 1 GB 的上下文。注释是可变的,因此您可以随着数据的变化来演化上下文。S3 注释与 S3 对象一起存储在 S3 存储中。这意味着 S3 注释会随着其关联的 S3 对象通过复制和复制操作一起移动,并且当对象被删除时,注释也会被删除。使用注释时,无需构建、同步或维护独立的元数据数据库,也无需担心其过时。

通过 S3 元数据,注释可以被查询。当您在存储桶上启用注释表时,每个注释会自动流入一个完全托管的 Iceberg 表中。您可以使用 Amazon Athena、Amazon Redshift 或任何兼容 Iceberg 的引擎,跨所有对象进行查询,代理也可以通过 S3 表的 MCP 服务器以自然语言发现注释。

借助 Amazon S3 注释,您可以直接将丰富的业务上下文附加到 S3 对象,并在大规模上进行查询,使代理能够找到所需内容,而无需构建独立的元数据系统。

上下文是 AI 代理的数据湖,通过这些创新,我们正在为 AI 代理在不同规模的企业和组织中与数据交互构建知识和智能的基础。

作者简介

Mai-Lan Tomsen Bukovec

Mai-Lan Tomsen Bukovec 是 AWS 的技术副总裁,她领导着 Amazon 云数据服务,数百万 AWS 客户依赖这些服务进行数字化转型、商业分析、机器学习、生成式 AI 以及下一代客户体验。拥有超过 25 年技术行业经验的 Mai-Lan 是帮助客户利用基于云的技术来转型业务的先驱者。