AWS Machine Learning Blog

Rethinking access control for RAG with Amazon Quick and Amazon Bedrock

8.5内容质量
Rethinking access control for RAG with Amazon Quick and Amazon Bedrock

TL;DR · AI 摘要

AWS提出通过实时ACL验证解决RAG访问控制难题,确保AI生成内容符合企业权限策略。

核心要点

  • 现有RAG方案依赖定期同步的ACL,存在权限过期风险
  • Amazon Bedrock Knowledge Bases支持实时权限验证,避免数据泄露
  • AWS方案兼容多源系统(如SharePoint/Confluence)的复杂权限模型

结构提纲

按章节快速跳转。

  1. 揭示RAG在企业知识库应用中的权限控制难题

  2. 分析定期同步ACL方法的3个核心安全漏洞

  3. 介绍Bedrock Knowledge Bases的实时权限校验机制

  4. 说明方案如何适配不同知识库的权限模型

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • RAG访问控制解决方案
    • 核心问题
      • 权限过期风险
      • 多源权限模型差异
    • AWS方案
      • 实时ACL验证
      • 直接对接原始权限源

金句 / Highlights

值得收藏与分享的关键句。

#RAG#访问控制#Amazon Bedrock#AI安全
打开原文

重新思考使用 Amazon Quick 和 Amazon Bedrock 的 RAG 访问控制 | 人工智能

重新思考使用 Amazon Quick 和 Amazon Bedrock 的 RAG 访问控制

企业组织正在采用检索增强生成(RAG)技术,以从公司知识源(如 Microsoft SharePoint、Google Drive 和 Atlassian Confluence)中挖掘洞察。然而,这些知识源包含受复杂权限结构管理的敏感信息。确保 AI 生成的答案遵循这些权限,是企业 AI 领域最具挑战性的难题之一。

在本文中,我们将探讨 Amazon Quick 和 Amazon Bedrock 知识库如何通过实时访问控制列表(ACL)执行,直接在查询时与权威来源验证权限,从而解决这一挑战。

业务问题

设想以下场景:SharePoint 站点所有者为组织创建了一个知识库。跨多个部门的团队成员使用 AI 助手从该知识库获取答案。关键要求是每个团队成员只能接收到他们被授权访问的文档生成的 AI 洞察。

这是一个普遍存在的企业难题。组织希望在不损害现有安全态势的前提下,实现对 AI 驱动洞察的民主化访问。AI 回答中出现一个未经授权的文档,可能会暴露机密战略文件、未发布的财务数据或敏感的人力资源信息。

为什么现有方法存在不足

RAG 访问控制的常见方法采用复制和过滤策略来执行文档级权限。其典型工作流程如下:

  • 数据源连接器(例如 SharePoint 连接器)作为定期同步任务的一部分拉取 ACL。
  • ACL 从数据源复制并作为属性存储在索引中。
  • 在查询时,AI 系统将登录用户映射到存储的 ACL 属性,并根据映射结果过滤结果。

尽管这种方法在表面上看似合理,但存在三个根本性缺陷。

问题 1:AI 系统不是权限的权威来源

在此模型中,AI 系统独自承担执行责任,但并非权限的权威来源。这要求数据连接器必须准确地在各种数据源之间复制复杂且特定于源的 ACL 逻辑。每个数据源都有其独特的权限模型。在数十个连接器之间映射继承层次结构、组成员资格、条件访问策略和拒绝规则是一项容易出错的工作。

问题 2:过时的权限会造成安全漏洞

通常,数据连接器支持基于拉取的同步,按需或按客户定义的计划运行。这些 AI 解决方案中的 ACL 是上次同步运行时的时间快照。一些解决方案使用基于事件的更新,但这种方法并不普遍适用。例如,像 Confluence 这样的数据源在组成员资格变更时不会发出事件。在同步期间,一个访问权限被撤销的用户仍可能接收到他们不应再查看的文档生成的 AI 答案。

问题 3:数据源功能的持续演变

数据源会定期变更或引入新的内容访问控制机制。SharePoint 的新权限功能或 Google Drive 共享模型的更改可能导致 ACL 映射逻辑出现漏洞。这可能会在连接器更新前暴露内容。

AWS 如何解决:实时 ACL 执行

为应对这些挑战,我们在 Amazon Quick 和 Amazon Bedrock 知识库现有的预检索 ACL 过滤基础上,新增了实时 ACL 检查作为额外的安全层。该机制通过在查询时直接与权威数据源核对权限,确保系统始终执行最新的访问控制策略。这避免了依赖可能过时或映射错误的 ACL 数据。

架构概览

下图展示了我们的混合架构,该架构同时实现了语义搜索性能和实时安全能力。

图1:Amazon Quick 和 Amazon Bedrock 知识库的实时 ACL 执行架构,结合预检索过滤(阶段1)与实时验证(阶段2)

实现原理:以 Google Drive 为例

当用户向使用 Google Drive 知识库的 Amazon Quick 代理提交查询时,系统通过两个阶段执行访问控制:

阶段1:预检索过滤

Amazon Quick 在向量索引中执行语义搜索,找到最相关的文档片段。系统应用已存储在索引中的访问控制列表,生成候选文档的初步集合。此阶段是必要的,因为对索引中每个文档进行实时 API 调用在规模扩大时成本过高。

阶段2:实时验证

Amazon Quick 通过调用 Google Drive API 实时验证候选文档。它使用管理员提供的服务账户凭证,通过模拟生成用户特定的访问令牌。Google Drive 作为文档相关访问控制列表的权威数据源进行维护。用户无权访问的文档将被排除在检索结果之外。只有经过验证且授权的文档片段才会作为上下文传递给大语言模型(LLM)。模型基于这些知识生成响应。

这种双阶段方法在性能与安全之间取得平衡。它通过缓存 ACL 实现效率,同时通过实时检查确保准确性。除了 ACL 执行,Amazon Bedrock 还提供负责任的 AI 控制,包括 Amazon Bedrock 安全防护(用于内容过滤)、事实核查(减少幻觉)以及可配置的安全策略,帮助组织负责任地部署生成式 AI 应用。

对您的组织的意义

该方法带来三个关键优势:

  • 永远保持权限最新 – 使用 RAG 产品时,无需担心同步周期之间的安全漏洞。当员工权限被撤销时,变更会立即反映在 AI 响应中,而非数小时或数天后。
  • 放心扩展 – 组织可以放心扩大知识库覆盖范围,因为实时 ACL 检查会针对每个查询(无论数据源如何)与权威数据源验证权限。
  • 降低运营负担 – 您无需担心同步频率问题。

“当我们的组织开始评估AI解决方案时,安全和合规团队明确表示他们的首要任务是确保同事只能查看他们被授权访问的信息。这是一个基本要求,但许多平台在实质性解决这一问题上存在困难。Amazon Quick的实时访问控制方法明确回答了这个问题,并在整个评估过程中展现了令人印象深刻的严谨性。这让我们的内部审查委员会充满信心,能够继续推进,并为我们未来思考AI治理方式奠定了坚实的基础。” — Jamahl Wiggins,高级专家 – M365创新,亿滋国际

亿滋国际已在全球四个地区部署Amazon Quick,覆盖其超过35,000名员工。

结论

在本文中,我们讨论了Amazon Quick和Amazon Bedrock知识库如何通过实时ACL强制执行解决企业的关键安全挑战。双层ACL架构在查询时直接与权威来源验证权限,确保AI生成的回答仅包含用户被授权访问的内容。

立即访问Amazon Quick和Amazon Bedrock知识库开始体验。

关于作者

'"`