SOP-Bench: A new benchmark for evaluating AI agents on real business procedures
TL;DR · AI 摘要
SOP-Bench是亚马逊推出的首个真实业务流程AI代理基准,包含12个领域2000+任务,揭示现有模型在复杂流程中的性能局限。
核心要点
- SOP-Bench包含12个业务领域2000+真实任务,配对工具和标准答案
- 11个前沿模型测试显示新模型未必表现更优,工具增加可能降低成功率
- 需针对具体任务选择模型,无单一方案适用于所有业务流程
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- SOP-Bench基准框架
- 业务领域覆盖
- 12个行业领域
- 2000+真实任务
- 评估维度
- 多工具协同能力
- 领域知识理解
- 歧义处理
- 测试发现
- 新模型未必更优
- 工具增加降低成功率
- 需任务特定评估
金句 / Highlights
值得收藏与分享的关键句。
SOP-Bench包含12个业务领域2000+任务,每个任务配对可用工具和标准答案
现有模型在真实SOP测试中成功率低于实验室环境,工具增加反而降低性能
测试显示没有单一模型在所有流程中表现最佳,需根据具体任务选择模型
SOP-Bench:用于评估AI代理在真实业务流程中的新基准 - Amazon Science
对话式AI
SOP-Bench:用于评估AI代理在真实业务流程中的新基准
可扩展框架使代理能够在完成流程所需的完整能力集上进行测试,而非孤立的代理任务
作者:
Rohith Nama
Nandi Subhrangshu
2026年8月21日
9分钟阅读
分享
- 复制链接
- 邮件
- X
- 领英
- Line
- QZone
- 新浪微博
- 微信
分享到微信
x
关键要点
- SOP-Bench 是一个开放基准测试平台,衡量AI代理在十二个业务领域真实标准操作流程(SOP)中的表现,包含2000多个任务,配有功能工具和客观评估的参考答案。
- 现有代理基准测试存在不足,通过干净的机器格式化提示测试孤立能力,而真实SOP需要协调多工具使用、歧义解释和领域专业知识,这是之前数据集所缺乏的。
- 跨十一款前沿模型的测试显示,新模型并不总是表现更好,附加工具可能降低成功率,没有单一模型-代理组合能在所有流程中表现优异,生产部署前需要特定任务评估。
- 该基准框架允许团队通过结合专家撰写的SOP、生成的工具接口和与真实答案的可复现评分,使用结构化方法评估自定义代理或扩展到新领域。
这个回答有帮助吗?
标准操作流程(SOP)是组织为正确完成重要常规工作而制定的书面步骤集合,确保每次都能以相同方式执行。几乎所有行业都依赖SOP运作。医院使用SOP注册新患者,物流团队使用SOP判断货物是否属于危险品,银行使用SOP验证新企业客户,信任与安全团队使用SOP决定是否移除某段内容。SOP以任何受训人员均可采用和遵循的形式,承载着组织辛苦获得的知识、合规规则和决策逻辑。因此,它们能确保不同员工、轮班和地点的操作保持一致和安全。
AI代理难以执行SOP,因为它们看起来比实际情况更整洁。真实流程要求读者解读从未完全说明的指令,运用领域内人尽皆知的知识,并在条件变化时做出判断。
以下是从患者入院流程中摘录的段落:
患者入院SOP摘录。
第四步和第六步要求操作员验证患者的保险信息,但未说明验证方式或为何需要验证两次。然而,有入院台工作经验的人知道,第一步是向保险公司确认患者保障,第二步则是确认患者信息已正确输入医疗提供者的管理系统。
今天,我们分享 SOP-Bench,这是一个公开可用的基准测试,用于衡量 AI 代理执行由领域专家编写的真实标准操作流程(SOP)的能力。它是首个将真实企业流程与功能工具和真实答案相结合的基准测试,因此代理必须通过完成流程来获得分数,而不是通过生成自动化评分器恰好喜欢的文本。我们在 2026 年知识发现与数据挖掘会议(KDD)上介绍了该基准测试,并展示了实验结果,显示即使是强大的基础模型在某些方面也存在不足,同时提供了一个社区可以进一步构建的评估框架。
为什么现有基准测试存在局限性
大多数代理基准测试只擅长一件事。一些测试模型是否能为请求选择正确的 API;另一些测试是否遵守书面约束条件;还有一些测试规划步骤序列以实现目标的能力。所有这些都是有价值的,但每种测试都只关注单一能力,并使用干净的机器格式提示进行测试,忽略了实际人员编写流程时的歧义和变异性。执行 SOP 需要所有这些技能,同时还需在相互依赖的步骤中协调使用多个工具、跟踪到目前为止发生的情况,并在事情未按预期进行时恢复。
SOP-Bench 独特地结合了实现真实工业工作流自动化所需的七种关键能力,填补了现有代理基准测试的关键空白。
过去尝试更贴近真实业务流程的努力遇到了限制。一些方法将书面流程转换为可执行的工作流,但仅限于狭窄领域的简短描述,且背后的数据库通常未公开。另一些方法发布了真实业务流程的集合,但仅停留在文本层面,没有提供工具或已知答案,无法让任何人通过代理执行流程并验证其工作。这就是 SOP-Bench 要解决的缺口。它整合了此前仅单独出现的要素:保留真实流程中的歧义、覆盖多个不同行业的广泛性、可供代理调用的可用工具,以及将结果与真实答案进行比对的评估方式。
我们构建了什么
SOP-Bench 将真实流程转化为可运行的任务。它覆盖 12 个业务领域,包括医疗接待、危险品分类、客户服务、内容审核、金融合规和仓库检查,总共有 2000 多个任务。每个任务都包含代理所需的工具接口和正确结果。代理通过调用工具执行流程,我们可以将其工作结果与真实答案进行验证,而不是依赖模型的主观判断。
SOP-Bench 是一个框架,而非一组固定的任务。它包含两个基准代理,但团队可以插入自己的代理,对其进行测试,并添加自己的流程。这是因为每个流程仅包含四个要素:SOP 文本、代理可调用的工具、这些工具的规范,以及一组带有已知答案的测试用例。
该框架会运行所有任务,完整记录每次决策的工具调用和推理过程,并根据已知答案对结果进行评分。评分可复现,失败情况可追溯到发生的具体步骤。实际上,这使团队能够在投入生产环境之前,先在自己的 SOP 上测试自己的代理。
构建跨行业的真实 SOP 非常困难,但这也是亚马逊的优势所在。亚马逊拥有来自所有相关领域的专家并行工作,这些专家已养成将工作记录为书面流程的文化,同时具备足够的基础设施,可同时执行数千个任务。
在构建 SOP-Bench 时,我们让专家与 AI 合作,但由专家最终确定答案是否正确。他们从真实的工业工作流中撰写原始流程并设置任务上下文。随后,Anthropic Claude 3.5 Sonnet v2 模型负责执行繁琐的机械工作,将每个流程转化为机器可运行的格式,并生成数据模式、模拟 API 和工具规范、工具代码以及故意混合常规案例与边缘案例和直接失败的测试数据集。每个生成的项目都会返回给专家,由他们确认逻辑是否成立、修正流程、检查数据并运行代码以确保行为正确。整个过程中均未涉及任何专有或敏感数据。
SOP-Bench 评估概览。由跨不同领域的人类专家撰写的现实业务流程 SOP 被转换为具有结构化工具/API 接口和真实输出的可执行任务。LLM 代理通过可复现的工具交互执行任务,其执行轨迹使用基于结果的评估指标(执行完成率(ECR)、完成任务成功率(C-TSR)和任务成功率(TSR))进行评估。
我们的发现
我们对 11 个前沿模型运行了两个刻意设计的简单代理:一个函数调用代理和一个推理风格代理。这些代理为其他系统改进提供基准,而非声称是最优系统。即便如此,一些模式依然清晰可见。
更新版本未必更好
最令人惊讶的发现是,升级模型有时反而会降低性能。在推理风格代理上,较新的 Claude 4.5 系列得分低于较旧的 Claude 4 系列。当我们在相同设置下比较单个模型时,这种倒挂现象依然存在。对于正在生产环境中运行代理的团队而言,这是最重要的发现,因为常规升级可能在没有明显变化信号的情况下降低成功率,而唯一可靠的方法就是测试团队实际运行的流程。
更多工具可能让代理表现更差
我们采用了一种视频标注流程,并为代理提供了两种不同版本的工具包。一种工具包恰好包含任务所需的六个工具,另一种则在保留这六个工具的基础上,又加入了20个看似合理但毫无实际作用的额外工具。即使所有必要的工具都可用,工具包规模扩大后成功率几乎减半。这说明能力并非免费,根据任务需求精简代理的工具可能是部署前的关键步骤。
没有单一配置能在所有场景中占优
没有任何一种模型与代理的组合在所有测试中都表现最佳,某组在某个流程中表现优异,往往在其他流程中却成为弱项。不同流程间的性能差距显著。在最简单的任务上,如按意图分类电子邮件,代理的正确率约为十次中有九次;而在最复杂的任务上,如对驾驶视频中的物体进行标注,正确率仅为四次中约一次,整个测试套件中差距超过三倍。仅依赖单一基准分数,团队几乎无法了解同一配置在下一个使用场景中的表现。
代理的构建方式与其内部运行的模型同样重要
当我们将两种代理在相同模型上进行直接对比时,推理型代理的平均表现略胜一筹,但在13次流程运行对比中仅在8次中胜出,且每次任务耗时约长三分之一。某些流程明显更偏袒某种代理,因此流程本身的特性,而非整体平均表现,应成为选择代理的关键依据。
一个尚未解决的问题与直觉相悖。一种主要由长时间阅读构成、仅需在少数几个节点做决策的流程,反而比包含更多决策点的流程给代理带来更多困难。直观认为复杂逻辑是难点,但在此测试中,看似更简单却更长的流程表现远差。我们并未断言阅读长度是唯一原因,因为两种流程在工具数量等其他方面也存在差异。但这也是基准测试旨在帮助探讨的问题,我们希望其他团队能与我们共同研究。
综合来看,这些结果并非对任何单一模型的最终判决。它们指明了领域仍需投入的方向,并提醒我们:单纯的能力建设无法保证在企业依赖的流程性工作中可靠运行。更实际的是,这些结果帮助团队识别仍需人工监督的具体步骤。AI在这些步骤上的弱点只有在持续使用工具、针对真实流程的测试中才会显现,这正是静态技能测试无法充分评估代理在流程性任务中与人工协同表现的原因。
按模型和代理类型统计的平均任务成功率(TSR),数据覆盖所有SOP。函数调用(FC)代理仅与Claude模型进行测试,因为它依赖LLM原生的工具调用功能。推理(ReAct)代理在所有模型上进行测试,以比较推理能力。
开始使用SOP-Bench
我们已在 GitHub 和 HuggingFace 上发布了完整的基准测试。此次发布包含 12 个专家撰写的流程、生成的工具和数据集、两个基线代理,以及用于将代理运行结果与真实值进行对比评分的评估代码。研究人员和团队可以将自己的代理与现有流程进行对比评估,或使用我们构建基准时采用的人类与人工智能相结合的方法,将基准扩展到新的领域。我们特别期待尚未覆盖的行业领域提交的流程。我们还计划增加相同流程的更难变体、包含图像和表格的指令,以及需要代理在流程中途切换上下文的嵌套结构流程。
如果您正在构建或评估代理,或希望更清晰地了解代理在日常运营工作中的表现,我们欢迎您的贡献和反馈。
研究领域
- 对话式人工智能
标签
- 智能体人工智能
关于作者
Rohith Nama 是亚马逊通用人工智能(AGI)组织的高级软件开发工程师,负责构建亚马逊 Nova 基础模型以及大规模负责任的智能体人工智能系统。
Nandi Subhrangshu 是亚马逊商店的高级资深科学家。