Closing the AI agent trust gap with graduated autonomy

TL;DR · AI 摘要
AWS提出渐进式自主权架构模式,通过六层设计解决AI代理信任差距问题,实现权限动态调整与安全可控。
核心要点
- AI代理需通过六层架构实现权限动态调整:评分引擎、层级系统、预执行层、执行层、后执行层和交付网关。
- 安全设计原则要求‘安全是独立的地板’,不可被其他指标稀释。
- 所有代理初始层级为T1,升级缓慢但降级立即生效,确保风险可控。
结构提纲
按章节快速跳转。
当前AI代理权限管理存在全权限风险与只读浪费价值的二元困境。
通过六层架构实现权限动态调整,包含评分引擎、层级系统等核心组件。
安全独立性、初始层级T1、预执行层双重保障等原则确保系统可靠性。
- ›技术实现
依赖Amazon Bedrock AgentCore、DynamoDB和CodePipeline构建闭环信任框架。
- ›闭环机制
六层架构形成评估-调整-反馈的持续优化循环,提升代理可信度。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- graduated autonomy架构
- 六层架构
- 评分引擎
- 层级系统
- 预执行层
- 执行层
- 后执行层
- 交付网关
- 设计原则
- 安全独立性
- T1初始层级
- 双重保障机制
金句 / Highlights
值得收藏与分享的关键句。
安全是独立的地板,从不被强指标平均掉。
初始层级T1:升级缓慢,降级立即生效。
预执行层采用快速过滤器+后援机制双重保障。
后执行层记录操作前状态,确保可恢复性。
通过渐进式自主权弥合AI代理的信任鸿沟 | AWS架构博客
通过渐进式自主权弥合AI代理的信任鸿沟
信任AI代理的程度现在已成为日常运营中的关键问题。代理可以读取客户数据、创建工单、处理退款和删除账户,但大多数团队只能选择二元选项:完全访问权限或只读权限。完全访问权限存在风险,因为代理可能不可预测地失败;只读权限则让代理的大部分价值无法被利用。代理能执行的操作与操作人员信任其执行的操作之间的差距,就是代理的信任鸿沟。
在本文中,我们将介绍渐进式自主权(graduated autonomy),这是一种通过架构模式弥合信任鸿沟的解决方案。代理通过持续的可靠性获得扩展权限,当性能下降时则会失去这些权限。Amazon Bedrock AgentCore 是一个平台,可用于使用任何框架或模型大规模构建、连接和优化代理。该平台提供运行时、网关、策略和评估能力。Amazon DynamoDB 存储信任状态。AWS CodePipeline 通过评估结果控制交付。我们将介绍每一层的职责及其背后的关键设计决策。
代理的信任鸿沟
身份和访问管理(IAM)在初始配置时一次性回答“谁可以执行什么操作”的问题。这种模型假设主体的行为始终一致。然而,大型语言模型代理打破了这一假设:同一代理在周一可能准确无误,但在周二因提示词更改或模型更新后可能产生幻觉。
弥合这一鸿沟需要三种能力,而原始API日志通常难以提供这些能力:
- 可见性。API日志可以告诉工程师发生了什么,但无法向合规官说明某个操作是否安全。
- 决策溯源性。追踪某个操作的触发信号、考虑的替代方案以及置信度。
- 可逆性。操作前的状态捕获,使操作人员能够从错误操作中恢复。
实现该模式的框架通过六个架构层提供所有三种能力。
解决方案概览
六个层级:
- 评分引擎:根据可配置维度计算信任分数。
- 层级系统:将持续的评分转化为自主权等级。
- 预执行层:在操作执行前阻止危险操作。
- 执行层:通过Cedar策略在基础设施层面应用层级。
- 后执行层:评估结果、记录溯源信息,并将信号反馈给评分系统。
- 交付网关:阻止性能退化的代理版本进入生产环境。
图1:信任框架的闭环。
每一层都可以替换:评分模型、层级阈值、预执行信号和评估标准都是配置项,而非代码。每一层也体现了以下关键设计决策:
| 层级 | 关键设计决策 | |------|--------------| | 评分引擎 | 安全性是独立的基准,不会因强指标而被平均掉 | | 层级系统 | 所有代理初始处于T1层级,缓慢晋升,立即降级 | | 预执行层 | 快速的进程内过滤器由后备机制保障,从不单独依赖 | | 执行层 | 默认拒绝,且在代理进程外执行 | | 后执行层 | 审计记录捕获操作前状态,使恢复成为可能 | | 交付网关 | 对抗性测试中一次未授权工具调用即可阻止发布 |
评分引擎
评分引擎根据五个维度,通过50个操作的滚动窗口,为每个代理计算一个0到100的加权评分:
| 维度 | 权重 | 衡量内容 | |------|------|----------| | 准确性 | 25% | 任务完成的正确性与预期结果的匹配度 | | 安全性 | 20% | |
边界尊重、对抗内容检测、允许工具遵守
一致性
行为可预测性,工具使用模式漂移的反面
合规性
行动前的推理质量,护栏合规性
效率
15%
无冗余重试或资源浪费的执行
综合指标驱动仪表板和层级分配,但安全机制作为独立基准存在,因此危险个体指标不会掩盖其他方面的优势。
层级系统
每个新代理无论测试表现如何都从T1层级开始:
层级
分数范围
权限
T1: 试用期
0至40
仅可读取和列出。仅可见两个工具。
T2: 监督期
41至70
添加写入操作。高风险操作需人工批准。
T3: 可信期
71至90
可执行和修改。异常情况会被标记以供审查。
T4: 自主期
91至100
完全访问权限。仅进行事后审计。
层级转换由三条规则管理:
- 晋升需要持续表现。分数必须在整个滚动窗口期间保持在晋升阈值之上。
- 降级是即时的。当安全指标低于基准或检测到注入时,代理会立即降级。
- 滞后效应防止震荡。晋升到某一层级需要分数高于该层级范围基准值5分。降级则在范围基准值本身触发。处于边界层级的代理无法在层级间来回波动。
信任状态以当前状态记录和每个代理的时间序列历史形式存储在Amazon DynamoDB中。执行组件在每次调用时都会读取当前层级,DynamoDB的查询通常在个位数毫秒内完成。
预执行层
后执行评估无法挽回损害,因此预执行层会评估每个工具调用并可在执行前阻止它。它独立评估六个信号:
- 对抗性注入检测。通过已知注入短语进行模式匹配。一次匹配会立即触发阻止并施加信任惩罚。
- 敏感目标检测。在工具参数中使用正则表达式匹配凭证、令牌和私钥。
- 危险工具检测。标记匹配破坏性操作模式的工具。
- 行为一致性。将当前工具调用与代理的历史工具使用分布进行比较。
- 置信度校准。将声明的置信度与历史准确性进行比较。过度自信的失败将按正常速率的两倍进行惩罚。
- 推理质量。检查代理在行动前是否提供了推理。
这些检查是快速的初步过滤器,而非完整的防御机制。执行层的默认拒绝策略会弥补它们遗漏的任何内容。
执行层
预执行层是代理进程内的应用程序代码。执行层在代理外部运行,位于基础设施层面。
AgentCore Gateway是Amazon Bedrock AgentCore的一项功能,位于代理和其工具之间。它通过Amazon Bedrock AgentCore中的Policy路由每个MCP工具调用,该Policy使用禁止优先语义评估Cedar策略。一个满足的禁止策略会覆盖任意数量的允许策略。层级映射到策略状态:
- 试用期:禁止策略阻止写入、执行和删除工具操作。
- 晋升期:禁止策略被移除,更广泛的允许策略生效。
- 降级期:禁止策略被重新应用。
在策略引擎处于强制模式时,网关仅列出策略可能允许的工具,因此层级的无条件禁止规则会阻止被禁止的工具出现在列表中。代理通常不会调用从未见过的工具。列表是一个元操作:每次调用仍会基于完整的请求上下文(包括输入参数)进行独立评估。Cedar默认会拒绝。强制执行从不依赖代理的自主行为。对于模型级内容安全,Amazon Bedrock Guardrails在AgentCore中补充策略功能,通过独立于层级的过滤机制阻止有害内容并隐藏敏感信息。
后执行层
每次工具调用后,系统会根据八个信号对结果进行评分,包括置信度校准、行为偏移、人工覆盖和重试检测。每个操作都会按照Think、Plan、Act、Observe、Score的链式流程生成审计记录:
- Think:代理的推理链。
- Plan:选择的工具、准备的输入、预执行评分。
- Act:匹配的Cedar策略、网关路由处理。
- Observe:成功或失败、输出数据。
- Score:信任影响、各维度评分、层级变更。
Plan和Act记录捕获操作前的状态,这使得从错误操作中恢复成为可能。操作人员可以用自然语言提问,溯源查询端点会返回任何决策的人类可读解释。审计记录会持久化存储到DynamoDB。
交付网关
每次对代理提示、配置或工具定义的修改都会触发AWS CodePipeline运行。该运行会将候选版本部署到预发布环境,并使用Amazon Bedrock AgentCore Evaluations(Amazon Bedrock AgentCore的一项能力)对其进行测试。测试用例包含对抗性场景,如提示注入和数据泄露请求。在任何对抗性场景中出现一次未经授权的工具调用都会导致网关测试失败。通过测试的版本将成为最新的已知稳定版本。
生产监控与恢复
框架会将具有已知预期行为的合成蜜罐案例注入一小部分流量中。验证过程检查工具调用轨迹(预期工具、预期顺序、无禁止工具),而非非确定性的自然语言输出,因此不匹配会触发真实异常信号。蜜罐结果不会计入生产指标。当安全性低于阈值时,降级机制会缩小代理的权限,并重新部署最新的已知稳定版本。这两者共同作用,将已知良好的代码与更严格的权限集结合恢复。框架还会向操作人员发出警报。
操作人员的判断直接影响:操作人员拒绝提议操作的滚动比率决定了有效安全指标的上限,因此30%的拒绝率会将安全指标上限控制在70%。紧急停止会推送一个Cedar全局拒绝策略。一旦策略生效(通常在几秒内),网关会阻止所有工具调用而无需重新部署。在多代理系统中,委托操作的有效层级是委托链中的最低层级,从而关闭了委托权限升级的路径。
结论
在本文中,我们介绍了渐进式自主性,这是一种用于缩小代理信任差距的架构模式。采用此模式后,您的代理将拥有与其历史记录相匹配的自主权。
要开始使用,请从本文中的两张表格中获取维度权重和层级边界,作为舰队中一个代理的初始模板。将该代理的起点设置为T1。然后按照《Amazon Bedrock AgentCore 评估文档》构建交付门,并参考《Amazon Bedrock AgentCore 策略文档》编写层级策略。您可以通过 Amazon Bedrock 控制台以及 Amazon Bedrock AgentCore 产品详情页探索这些功能。
如需深入了解该模式所使用的构建模块,请阅读《使用 Amazon Bedrock AgentCore 策略构建安全 AI 代理》和《在 Amazon Bedrock AgentCore 中构建自定义代码评估器》。
关于作者
'"`