Elevate

Agentic Autonomy Levels

6.9内容质量
Agentic Autonomy Levels

TL;DR · AI 摘要

Agentic Autonomy Levels - by Addy Osmani - Elevate Agentic Autonomy Levels A working model of autonomy for agentic engin...

核心要点

  • 主题聚焦:Agentic Autonomy Levels
  • 来源:Elevate,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#前端#后端#云计算
打开原文

智能体自主性层级 - Addy Osmani - Elevate

智能体自主性层级

一种适用于智能体工程的自主性模型

Addy Osmani

2026年7月3日

在关于智能体工程的大多数讨论中,行动已经从提示转变为操作。这里有一个探索迷雾前沿的领域:软件工厂、目标、循环、后台会话、子智能体、钩子、沙盒、批准智能体的智能体。对于许多未来创造者而言,这种行为将在产品第一天就内建完成:Claude Code和Codex直接暴露了这一转变。

从工程师视角来看,您将使用低自主性来限制风险并提高可逆性,但会使用高自主性来执行明确任务,并安全地运行大量并行智能体对大规模代码库进行重构。关于某个行动的核心问题始终是:这个任务应被赋予什么层级,以及哪些验证措施能让这个层级具有说服力?

前沿的边缘是管理智能体,它在触发时唤醒,将任务委托给助手,同时持续验证输出结果,只返回必须由人类决策的决定。使用这种架构的人可能已经运行了数百甚至数千个智能体,主要针对持续维护的代码库。就像所有关于自主性的思考一样,每个人对规模的感知仍然存在差异。

最常被提及的规模是Steve Yegge在《欢迎来到Gas Town》和《实用工程师》中提到的单轴阶梯。如果您想了解自己AI原生程度的数字,这是一个不错的参考:该阶梯为您提供一个单一数字来衡量您对单个智能体的信任程度。这里有一个版本:

2026年初,当工作开始从委托转向编排时,这仍然是衡量风险的较好代理指标。然而今天,当您能同时运行多个智能体时,许多技能组合可能具有更大的重要性和杠杆效应。单个阶梯无法帮助您评估多智能体技能。

相反,几乎所有关于自主性的讨论都混淆了两个应分开的问题:我们允许这个单一智能体离自己有多远,以及我们协调多个智能体的技能如何?

为了分别捕捉这两个维度,我们将使用两个轴:智能体性和编排性。

在智能体性轴上,低级别包括提出候选操作并等待决策。

中级别意味着智能体正在处理特定任务,但会限定其行为范围,并持续报告其行为及证据,以便您继续引导。

在高级别智能体端,智能体正朝着目标前进,进行实验、学习、测试、寻找解决问题的方法、遇到阻碍时提问、尝试不同方法,并将所有工作作为证据返回。

在编排性轴上,低级别意味着一个智能体、一个线程。中级别时,您有多个智能体,每个智能体在自己的工作树中工作,可能朝着不同目标前进,但彼此隔离。在高级别时,您有一个编排器,可以将待办事项、问题跟踪器、计划或其他队列转换为持续工作,您只需在出现问题时介入:"异常管理"。包含这些理念的产品和功能包括:

  • Claude Code的/plan、/goal、/loop、/background、/batch、/code-review、/security-review模式,子智能体、钩子、检查点、智能体委托和管理实践、后台会话、智能体团队模式、/schedule参数
  • Codex 的本地/云端线程、目标模式、工作树、自动化、子代理、审查面板、GitHub 代码审查、钩子、沙箱、自动审查和重新运行

这些功能无法用单一的阶梯来描述。

攀登过程:三个时代与统一的技术栈

如果你从阶梯底部向上阅读,你想象的是同时攀登代理能力和编排能力。实际上,这六个层级代表了我们所有人都会经历的三个不同时代:

首先,你坐在驾驶座上,代理主要只是协助,等待你来指引方向。

其次,代理接管一个有限的任务或目标,但你仍然在场进行指引并验证其行为。

第三,在编排时代,系统能够自主运行,将工作分配给多个代理,你只需在出现问题时介入:"例外管理"。

这使事情变得简单,因为阶梯上的垂直位置清晰地捕捉了两个维度(编排能力仅在顶部附近启动),从而形成了一条连贯的攀登路径。然而,这种攀登仍然是我们正在经历的转变的一部分。

一个工程工作的良好日子通常会涉及多个层级,有时甚至更多:在任务过程中在不同时代之间切换是正常的。

六个层级的详细说明

第 0 级:辅助

代理提出大多数时候良好且经常完美的建议,但你始终决定这些建议是否足够好到可以执行。这类似于自动补全、内联编辑建议,或在聊天会话中讨论一个尚未有人认领的更改。适用于代价高昂的错误、微小更改或当你自己形成判断时。验证主要在本地进行。

第 1 级:监督操作

代理代表你编辑或运行命令,在执行任何重要操作前会征求你的意见。这是大多数人默认的模式。可以在本地沙箱中通过审批后应用更改(每个审批都是独立验证更改是否可以应用的证明),或在交互会话中进行。失败模式是审批疲劳;所有审批在感觉上都是一样的,无论它们批准的是什么。你可以通过仔细查看差异、遵循一些启发式方法、在批准前与其他人确认,或简单地同意让代理负责来解决这个问题。Codex 自动审查通过将边界条件的最终审批委托给独立的审查代理来解决这个问题。

第 2 级:有限任务委托

将一个有限的任务交给代理。该任务将有明确的目标、约束条件和完成的定义。你将保持在附近,可以随时中断,但大部分时间不参与。这是软件工程世界的重心。验证正在从你身上转移(你可能需要休息和睡觉)到代理能够生成的证据:通过自动化测试、正确的类型、代码检查建议、截图、重现步骤、通过示例证明的来源等。

第 3 级:目标驱动的自主性

代理会尽一切努力实现目标,直到满足某个条件才会停止。在提示模式下,这意味着提示本身即为要达成的目标(例如:“你能将该页面的交互响应时间缩短至1秒以下吗?”)。在Codex中,这被称为目标模式:代理会循环执行计划、行动、测试和复审步骤,直到不再满足成功标准。在Claude Code中,则通过/goal、/loop和/schedule命令实现。要使这一层级发挥作用,停止条件必须能够以可自动衡量的方式定义。

不要要求代理协助实现模糊、宽泛的目标,比如“总体提升用户体验”或“让代码库更易于测试”。应选择具体、可衡量且可自动化的任务,例如:找出静态分析无法发现的生产环境中的缺陷、缩短加载时间、确保我们拥有严格且无显式any类型的TypeScript构建、对所有依赖项进行分类,仅保留我们理解且通过测试的依赖项等。最后,若要发现生产环境中的缺陷,代理必须处于接近生产环境的环境中。

第4级:并行委托

同时让多个代理协作工作。每个代理独立处理任务的一个切片。这一层级最大的瓶颈在于分解:定义正确的切片以进行委托。支持功能包括:子代理、后台会话、/batch、工作树、代理团队等。失败模式是虚假并行:同时让多个代理处理重叠的切片,导致合并冲突和重复决策,而非更多工作。要实现良好的并行处理,代理之间必须相互隔离,各自拥有独立的文件和状态。每个代理还需要独立的审核队列。最后,每个代理都会产生成本——以消耗的token数量衡量,与同时运行的代理数量成正比。对人类而言,随着代理数量增加,协调成本(orchestration tax)会逐渐上升。

第5级:异常管理式编排

定义成功的表现形式及适用的政策。管理代理会根据触发条件(例如新问题、新任务、定时器)启动,分配工作者代理,监控进度,验证输出,失败时重试,满足条件时升级至更专业的代理或人类,汇总结果,并最终将工作成果(例如PR)和证据返回至外部系统。想象工厂:问题跟踪器或待办事项列表是输入,工厂产出的是结果(即大量修复的问题和缺陷)。代理在适当隔离的环境中工作,有大量隔离墙(如需,还设有逃生舱),而唯一定义工厂职责的操作系统由管理代理指定。

该操作系统的设计由人类负责;OpenAI提出了Symphony的规范,其中心是Linear看板:每个问题都有独立的代理工作空间,代理会持续确保其按照工作空间内规范文件中定义的目标推进。人类审核可在证据生成的层级进行,但最前沿(即编排世界中最强大的能力)是构建包含数百甚至数千个代理的持续运行代理工厂。在攀登至此阶段后,独立验证变得越来越重要:独立的实现者和审核者、独立的测试执行者和QA团队、独立的安全检查、独立的接受流程关卡。

风险与可逆性设定了上限。

我曾读过Anthropic之前关于Claude Code执行困难任务的研究,发现系统请求澄清的频率是用户主动中断的两倍多。经验丰富的用户(约750次会话 vs 少于50次)更倾向于自动批准操作并主动监控进度。

他们还对Claude Code的使用方式进行了更广泛的分析。研究涵盖了2025年10月至2026年4月期间约23.5万名用户产生的40万次会话。通过分析每次会话,可以推断出用户的决策模式,例如每次提示中请求的操作数量、自动批准的选择比例、中断频率等。人们承担了约70%的规划决策,但Claude执行了约80%的操作。高自主性并非意味着排除人类参与,而是从让人类执行每一步骤转变为让人类决定下一步方向。

如果我们想判断大型AI系统是否具备高自主性,应该提出三个关键问题:

  • 我们能多快发现系统行为与预期不符?
  • 我们能多干净利落地撤销系统行为?
  • 什么证据能证明我们的判断是正确的?

如果这三个问题的答案分别是:无法快速发现、难以撤销、只能依赖摘要信息,那就说明系统不具备高自主性。

每次代理程序运行前都应签订明确的契约,定义其目标:

目标:我们试图实现的成果(不是活动本身,也不是技术手段,而是最终结果)。

范围:操作的领域边界及允许使用的技术手段。

非目标:不属于目标范畴的内容。

工具与权限:代理与外部世界交互的方式。停止条件:何时终止运行(理想情况下应有可衡量的变量)。

证据:可验证任务完成的独立证据,如特定测试、截图、日志、数据库记录等。

升级机制:在何种情况下需要哪些人员介入(包括代理运行的负责人)。

预算限制:对时间、人力和计算资源(token是大型AI模型的预算单位)的投入限制(也可设定任务尝试次数上限和并行度上限)。

指标让自主性更具可靠性

事后确定指标可能并不充分。可以在简洁的文档中预先设定指标,这能让自主性显得更可靠,也让信任的跨越更容易实现。

尽管有多种衡量成功的方式,但建议为每个自主性层级跟踪以下指标:

  • 干预间隔平均时间
  • 最长连续成功运行时间(含已接受工作)
  • 沙盒环境执行动作占比 vs 升级处理占比
  • 自动批准动作占比 vs 拒绝动作占比
  • 每条人工指令对应的代理动作平均数量
  • 澄清请求率 / 中断请求率
  • 每项接受变更的审查时间
  • 各置信度层级的返工率
  • 各置信度层级的缺陷逃逸率
  • 每项接受变更的token成本

这些指标能讲述故事:一个需要人工频繁交接才能保持忙碌的代理,其自主性等级为4(配有仪表盘)。一个保守型代理,除非获得自动化输入、重试和充分证据,否则不愿继续执行,其自主性等级为5(配有真正的门禁机制)。

考虑准备就绪程度

按风险等级和工作可逆性对任务进行分类。应谨慎应用自主性,仅在高级别支持证据充分积累时逐步提升。受强测试保护、具备清晰回滚路径的支付引擎重构任务,其自主级别可远高于缺乏权威标准的文档自动化任务。自主级别应由验证流程决定,而非任务名称。

四种反模式

除非保持警惕,否则所有系统都可能陷入这四种自主性反模式。

自主性作为地位象征 - 代理的自主级别演变为无意义的地位标志。高自主级别被视为能力证明而非安全证明,导致代理运行强度超出验证支持范围。解决方案:表彰并奖励那些准确确定自主级别且坚决避免越界的人员。

权限漂白 - 审批疲劳的暴政使我们过度授予AI代理和工具不必要的广泛权限。解决方案:始终通过更严格的边界控制(如沙盒配置文件、作用域写入根目录、白名单命令、钩子和自动审核)进行修复。

摘要替代审查 - 代理的工作摘要取代了审查流程,假设摘要本身已足够。解决方案:与全人工审查打包相同的证据包(包括差异对比、测试结果、日志、截图、审查员发现、风险点、空白项等),同时避免认知妥协。

舰队角色扮演 - 数十个代理并行运行时,人类仍坚持手动协调所有依赖关系。解决方案:通过共享状态、所有权规则和更完善的依赖跟踪逐步减少手动协调需求。更小的WIP限制迫使聚焦于编码和记录协调步骤,直至编排实现自动化。

校准练习

回顾你最近完成的10项使用代理协助的任务。对每项任务,记录所采用的自主级别、涉及的风险、工作可逆性、为满足验证要求产生的证据、审查时间、是否需要返工,以及所选自主级别是否仍适用于下次。

安全攀登指南

每次只沿一个轴线提升。从单个受监督代理执行单一范围任务开始(若足够整洁,可视为自主级别1),该任务需产生可辩护的成功证据。然后逐步向三个正交方向扩展:并行化读取密集型探索任务(自主级别4);添加作用于独立工作树且受文件所有权规则约束的写入代理(自主级别4);添加周期性自动化,再基于问题、语音等的代理主导编排。每个自主级别提升都需要新的安全机制(如新的故障模式)。

命名规范:更长的单代理运行可能导致偏移、上下文腐化、通信丢失或目标偏离。后台工作可能导致过时假设和薄弱交接。过多并行工作可能导致合并冲突或重复决策。过多周期性工作可能导致静默代币消耗或过时提示。异常管理模式可能导致审查队列过长和警报疲劳。解决方案不是信任更难的机制,而是缩小范围、确保更充分的证据、启用更低成本的回滚路径、强化关卡并定义更清晰的所有权规则。

使用自主级别

  • 0级最适合精细操作和判断仍在形成阶段的任务。
  • 级别 1 最适合大多数探索性工作,当工作接近已知范围的边界时。
  • 级别 2 最适合有明确边界的任务,清楚存在未知依赖项和潜在隐患的可能性。
  • 级别 3 最适合成功条件能清晰表述的场景。
  • 级别 4 最适合工作内容能明确划分到不同成功条件中的场景。
  • 级别 5 最适合在各种成功条件间所需的协调与沟通机制已完全编码的场景。

验证环节始终是瓶颈所在。

尽管当前工具和宣传充满自信,但与AI代理协作的成熟工程团队应保持"校准自主性"的成熟姿态。

在不远的将来,我们需要设计能够判断何时执行任务、何时验证结果、何时寻求帮助的循环机制——但工程师的核心技能仍将在于选择合适的自主程度,并构建能够防范其潜在风险的模式和可辩护的证据体系。