Apple Machine Learning Research

Agent Seer: Synthesizing Scenarios from Specification Understanding

8.5内容质量

TL;DR · AI 摘要

Agent Seer通过工具规范自动生成评估场景,无需手动创建或实时工具执行,提升AI代理测试效率。

核心要点

  • Agent Seer利用MCP规范生成多轮对话,无需人工干预或工具执行
  • 参数模式复杂度是评估场景质量的最主要影响因素
  • 该方法在7个领域测试中实现小规模规范100%工具覆盖

结构提纲

按章节快速跳转。

  1. 人工构建测试场景存在领域依赖性和扩展性缺陷

  2. 基于MCP规范的语义信息自动生成评估场景

  3. 通过七领域测试验证工具调用正确率和对话连贯性

  4. 参数模式复杂度是质量差异的主导因素

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Agent Seer
    • 核心机制
      • MCP规范解析
      • 合成多轮对话
    • 实验结果
      • 7领域测试
      • 参数复杂度影响

金句 / Highlights

值得收藏与分享的关键句。

#AI代理测试#工具规范#自动化评估#机器学习
打开原文

Agent Seer:从规范理解中合成场景 - 苹果机器学习研究

研究领域

数据科学与标注

,

工具、平台、框架

内容类型

论文

发表时间

2026年8月

Agent Seer:从规范理解中合成场景

作者:Harish Karumuri, Mahesh Vemula, David Lopes Pegna

查看出版物

复制Bibtex

评估使用外部工具的AI代理需要能够反映从业者如何组合工具并在对话轮次间迭代的真实测试场景。手动构建此类场景需要深厚的领域专业知识,无法跨工具生态系统扩展,且生成的静态基准无法跟踪不断演进的API。我们观察到,工具规范(函数名称、自然语言描述和类型化参数模式)已经编码了足够的语义信息,可以在不进行人工策划或实时工具执行的情况下合成现实的评估场景。Agent Seer正是基于这种潜在信息:仅从单一的模型上下文协议(MCP)规范出发,无需示例、无需实时工具访问、无需领域特定调优。该流程增强了原始模式,生成带有合成工具输出的分级场景,并将其扩展为基于模拟数据的多轮对话,展现出强大的工具调用正确性和对话连贯性。通过在七个涵盖不同领域和工具套件规模的MCP规范上应用该流程,并测量工具调用正确性和对话连贯性来评估质量。该流程在所有领域均表现出色,在小型和中型规范中实现了完整的工具覆盖率。分析中得出两个发现:参数模式复杂度是质量变化的最强相关因素——工具套件规模起着较小的正交作用;而在不完美的场景中,参数值准确性是主导的失败模式,这是粗粒度名称匹配指标无法捕捉的子维度。

相关阅读与更新

PORTool:基于奖励树的重要度感知策略优化,用于多工具集成推理

2026年5月4日 研究领域 语音与自然语言处理 , 研究领域 工具、平台、框架

多工具集成推理使基于大语言模型的工具使用代理能够通过将自然语言推理与外部工具调用交织在一起解决复杂任务。然而,仅使用结果奖励训练此类代理会面临信用分配模糊的问题,难以明确哪些中间步骤(或工具使用决策)导致了成功或失败。在本文中,我们提出了PORTool,一种重要度感知的策略优化算法,该算法……

阅读更多

强化代理:工具调用代理的推理时反馈

2026年5月1日 研究领域 方法与算法 , 研究领域 工具、平台、框架 ACL研讨会

本文被ACL 2026第五届自然语言生成、评估与度量研讨会接受。

工具调用代理的评估涉及工具选择、参数准确性和范围识别,但大语言模型轨迹评估本质上是事后分析。脱离主动执行循环的此类评估只能识别通常通过提示调优或再训练解决的错误,且根本无法……

发现机器学习领域的机遇

我们的机器学习研究每天都在取得新突破。

与我们合作 /think