Echoverse: Deep, evolving environments for computer-use agents

TL;DR · AI 摘要
微软研究院推出的Echoverse框架通过深度、动态的训练环境显著提升计算机使用代理的性能,实验显示9B模型基准测试得分提升至67.1%。
核心要点
- 高仿真训练环境使模型基准测试得分从36.5%提升至67.1%
- 强化学习结合验证器使模型步骤效率提升30%
- 开源4个训练世界代码和数据集(microsoft/Echoverse)
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Echoverse框架
- 训练环境
- 12个深度世界
- 高仿真数据
- 实验成果
- 9B模型得分67.1%
- 接近GPT-5.4
- 技术突破
- 共同进化机制
- 强化学习验证器
金句 / Highlights
值得收藏与分享的关键句。
高仿真度是必须的;浅层世界会损害代理性能。
共同进化模型、世界和验证器可使三者性能同步提升。
强化学习使模型在测试集上步骤效率提升30%。
Echoverse:面向计算机使用代理的深度、动态环境 - 微软研究院
/.itemprop=publisher
/itemprop=image
Echoverse:面向计算机使用代理的深度、动态环境
发布日期:2026年7月30日
作者:Akshay Nambi,首席研究员 Yash Pandya,高级研究工程师 Sahil Gupta,研究实习生 Sarthak Harne,研究研究员 Archana Yadav,软件工程师 2 Kavyansh Chourasia,研究软件工程师 2 Yash Lara,高级项目经理 Ahmed Awadallah,合作研究经理 Ece Kamar,人工智能前沿首席副总裁及实验室主任
分享此页面
- 在Facebook上分享
- 在X上分享
- 在LinkedIn上分享
- 在Reddit上分享
- 订阅我们的RSS源
/#single-header
在数量规模之外提升仿真精度,聚焦代理实际缺乏的能力,并与训练模型共同进化
一目了然
我们为计算机使用代理构建了十二个训练世界:十个深度领域世界和两个能力世界,每个世界都针对单一控制组件(如日期选择器和嵌套筛选器)进行深度训练,以多种形式呈现。深度是这些世界值得训练的关键:这些世界复现了应用程序的真实行为,预置了真实数据,并能在不同屏幕和用户间保持状态一致性。在十二个世界中进行训练后,一个9B参数模型的基础得分几乎翻倍(从36.5%提升至67.1%),与GPT-5.4的差距仅剩14分。该实验让我们得出以下结论:
- 高仿真精度是必须的;浅层世界会损害代理。在相同网站的浅层和深度构建上训练时,模型在浅层构建上表现退化,但在深度构建上表现提升。
- 代理常常在相同具有挑战性的UI元素(如日期选择器和嵌套筛选器)上遇到困难。通过以多种形式训练这些控件,模型学会了在训练中从未见过的领域中操作它们。
- 模型、世界和验证器的协同进化能提升所有组件。随着世界变得更准确、任务变得更困难,模型能力也随之提升。
- 与世界进行强化学习能让代理超越模仿。使用基于真实场景的验证器作为奖励,强化学习提升了模型的保留测试表现,并教会代理以更少步骤达成目标。
- 我们将发布四个世界及其代码、数据和基于真实场景的评分器,以支持高仿真计算机使用世界的科研。GitHub:microsoft/Echoverse: Deep, Evolving Environments for Computer-Use Agents(在新标签页中打开) Hugging Face:microsoft/Echoverse · Datasets at Hugging Face(在新标签页中打开) 技术报告:https://www.microsoft.com/en-us/research/publication/echoverse-deep-evolving-environments-for-training-computer-use-agents-at-scale/
计算机使用代理只有在行动产生真实后果时,才能学习其行动的结果。一次点击会改变保存状态,一条消息会传递给真实用户,或一个无法移动的页面会告诉代理其上一步操作无效。截图可以展示界面外观,但只有运行中的世界能展示操作引发的结果。
值得学习的后果是具有状态性的,且大多数需要登录才能访问。人们希望自动化的功能主要存在于封闭系统中:电子邮件和聊天、银行、健康记录、云和机器学习的内部控制台。你无法在这些系统的实时版本上训练代理。每一次尝试都会写入真实账户,尝试之间没有重置,真实状态始终隐藏在屏幕后。因此你重建系统为一个合成世界,其中数据库由你掌控:状态是真实且实际变化的,但可以安全地破坏、快速重置,并通过数据而非截图进行评分。
聚焦:AI驱动的体验
微软研究协作者体验
通过我们的AI驱动体验,深入了解微软的研究
立即开始
/.msr-promo__content
/.msr-promo__inner-wrap
在新标签页中打开
注入的推广内容
/.msr-promo
当我们说"世界"时,指的是三个要素的结合:环境(应用程序、其状态以及改变状态的操作)、在其中设定目标的任务,以及将结果与真实情况对比的验证器。社区现在擅长构建这些要素:流水线可以启动应用程序、初始化数据、生成任务并附加验证器,从而产生数百个环境和数千个可检查的任务。这项工作在此基础上更进一步。然而,当世界数量充足后,其内部结构反而成为瓶颈:无论状态在不同用户和屏幕间是否保持连贯,工作流始终保留依赖关系,薄弱技能以足够多的形式重复出现以实现泛化,成功标准由结果或外观决定。
我们的赌注——Echoverse所验证的——是真正的杠杆效应更多来自持续改进已有世界的循环,而非单纯增加新世界。它将构建环境和训练模型视为一个过程而非两个阶段:在某个世界中运行模型,找出其失败之处,然后在该世界、其任务和验证器上使其更忠实或更具挑战性,基于更清晰的信号进行训练,然后重复这一过程。普通的微调仅改进模型本身。在这里,衡量模型的相同评分运行也会改进评判它的世界,因此静态基准会饱和,而循环会持续累积改进。
三个杠杆保持该循环的生产力,其中任何一个都不是单纯的环境数量。深度:为关键领域(包括封闭和专有系统)构建行为忠实的世界。能力定位:围绕模型反复失败的具体交互构建高度聚焦的世界。协同进化:在每次评分运行中持续改进环境、任务和验证器,而不仅仅是模型本身。
图1:学习循环:每次评分运行会被读取两次。存活下来的失败案例成为模型训练数据,世界、任务或验证器中的缺陷则被修复。衡量模型的同一评分运行也会使世界更加精准。
为什么采用合成世界,以及为何需要深度?
开放且无需登录的网站看似消除了对合成世界的需求,但它们实际上并非训练的理想场所:它们无法保持稳定。页面会被重新设计,列表和日期会不断更新,主机可能会限制或阻止自动化流量,因此与这些网站绑定的基准会逐渐偏离,每次运行所面对的网站都不尽相同。偶尔的评估可以吸收这种变化,但训练无法做到这一点,因为训练需要重复执行相同任务数千次,每次都需要相同的环境。合成世界在时间和数据上是固定的:日历不会变动,种子数据不会更新,任务在第1000次部署时与第一次部署时的含义完全一致。我们以牺牲一些表面的真实性为代价,换取一个完全可控的世界。
控制力只是基础。一个世界可能完美稳定,但内容可能空洞,因此决定训练价值的是深度:不是页面数量,而是它多忠实地保留了工作流程的因果结构。五个特性设定了标准:行为保真度(控制、权限和错误遵循产品的逻辑);状态一致性(发送的消息会出现在接收者界面,取消的会议会在双方日历中消失);流程深度(早期的选择会影响后续发生的事情);权威验证(应用状态,而非像素);以及领域价值(该流程值得改进)。在最重要的系统中,难度主要体现在权限、共享状态和审计历史中:这正是浅层克隆所跳过的结构。高于这一标准,更多环境会增加多样性;低于这一标准,它们只会增加噪声。
Echoverse工厂的工作原理?
Echoverse是一个单一的流水线,拥有两个输出:完整领域世界(保留流程深度)和能力世界(仅改变一个被诊断的交互)。两者都依赖于我们拥有底层数据库这一事实,因此成功是应用状态本身的属性,而不是模型对截图的解读。
构建世界
流水线将少量种子场景扩展为规范,然后将其编译为关于路由、状态和行为的可机器验证的声明。只有在完成这些步骤后,才会生成应用:一个基于React界面的FastAPI和SQLite后端。一个新应用只是一个假设,而非真实世界:构建者会将每个声明与运行环境进行比对,修复数据库、后端或前端,直到每个声明都通过测试,然后生成一个准备记录,将硬性障碍与建议性风险区分开来。存在开放性障碍的世界无法推进。这里的深度不是提示中的承诺,而是世界已通过声明的列表。
扩展语料库
一个能干净构建的世界仍然不是训练数据。我们会将每个任务重新锚定到实时数据库,从实际存在的实体中提取目标,然后将每个目标发送给分析面板:其实体是否真实?目标是否合理?难度是否与工作匹配?最关键的是,驱动真实UI的代理能否完成该目标?最后一步检查在浏览器中执行,能在模型看到这些目标之前,就筛选出无法通过任何界面完成的目标。生成的目标是一个声明;在真实应用中解决该目标则是证明。
每个失败都会被标记为需要更改的层的问题:数据库、后端、前端、任务文本或验证器。特定于层的修复程序会应用修复,将其与运行中的应用程序重新检查,如果出现回归则回滚。循环将持续与数据库的基准事实重新评分,直到通过率停止上升,每个存活的任务都会携带用于评分的确切检查。这些任务通过一个过程成为训练数据:GPT-5.4解决每个任务,验证器保留通过基准事实的轨迹,这些轨迹成为下方每个实验背后的监督微调(SFT)数据。
构建世界和扩展语料库并非两个阶段,而是一个循环:大多数缺陷属于世界本身,因此我们每次迭代都会重新版本化环境。更难的任务会暴露世界中的缺陷,而更坚固的世界能够承载更难的任务,因此每一轮都会使两者都变得更强大。
图2:环境工厂:每个世界背后的两个循环。阶段1将少量种子扩展为一个应用程序,然后修复数据库、后端和前端,直到其通过可机器验证的声明。阶段2基于实时数据重新定位任务,运行分析器和特定于层的修复代理小组,持续与数据库基准事实重新评分,直到通过率趋于稳定。许多这些修复会直接进入世界本身(虚线箭头)。
验证器以数据库为根基
每个任务都携带自己的答案密钥,该密钥由生成时的SQL查询从真实数据库中生成,构造时即为真实,并在代理完成任务后重新检查。读取操作会根据语义等价性与存储值进行评分(288与287.62通过);写入操作则基于真实数据库的前后差异进行评分,因此除非某行状态发生翻转,声称票证已关闭将失败;读写操作则取两者中的较低分。评分机制难以被操纵,基于真实数据而非标签,且在EchoStay预订、EchoForge问题和EchoBank转账等场景中保持统一。
完整领域承载完整工作流
对公共基准测试最具挑战性的领域恰恰是最难达到的:封闭的专有系统,其难度体现在权限、共享状态和历史记录中,而非界面布局。忠实的克隆必须复现这些特性。关键不在于像素,而在于某个操作的后果能够跨屏幕和用户传播,因此任务可以运行真实的工作流,并根据其留下的状态进行评分。
十个Echo领域涵盖通信、技术工作、受监管记录、社区、媒体和旅行。在存在丰富公共数据集的领域,我们基于其构建:EchoStay从InsideAirbnb种子数据生成,因此其房源、房东、评论和设施都是真实而非虚构的;EchoForum基于包含255万条评论的公共论坛语料库构建。在不存在数据集的领域(如邮件、日历、银行和健康记录),种子生成管道会在严格约束下生成状态,确保数据密集且内部一致,而非仅几个占位符行。
工作流类别
环境
世界必须承载的深度
通信与协作
EchoMail、EchoCalendar、EchoChat
共享线程、日程、参与者、权限、历史记录
技术创作与操作
EchoML、EchoForge
工件、配置、依赖项、角色、多阶段变更
受监管记录与交易
EchoBank、EchoCare
余额或记录、授权、审计历史、具有后果的写入
社区、媒体与旅行
EchoForum、EchoTunes、EchoStay
持久偏好、社交状态、搜索、预订、账户操作
表1:Echo家族的十个全领域环境,按其代表的工作进行分组。每个环境都是一个广泛使用产品的忠实替代品,以工作流程而非品牌命名。
这种积累的状态使操作的后果能够跨越屏幕和用户。在EchoStay中,一次预订会通过搜索、列表、可用性和支付等流程,经过约87个路由和23张表格,但没有确认屏幕;EchoMail的对话线程则从草稿到发送、回复和标签状态持续传递意图;EchoCare的订单会将每次更改记录到审计跟踪中。这些任务因此变得复杂,通常需要五到二十个操作步骤,只有在底层状态发生变化时才算完成。
图3:Echo套件中各领域的详细信息。每个环境都作为其模拟应用的自包含、完全交互的克隆版本发布,拥有自己的后端、预填充数据库和功能界面。统计数字基于数据库状态,而非原型图。
能力世界隔离单一技能
并非所有弱点都代表缺失的领域;有些是由于代理无法可靠操作的单一控件导致的。设想一个代理正在预订旅行:它进行搜索、筛选、打开正确的列表,但在日期选择器处停滞,无法将“三月第二周”转化为陌生日历上的正确点击。构建另一个预订网站无法解决这个问题。只有当控件本身以足够多的形式出现时,技能才会被学习,而日期选择器和嵌套的筛选-搜索功能在实时网络中无处不在,以一百种不同方式呈现,这正是单一深度应用无法提供的变异性。
因此,我们隔离控件并扩展交互,大规模地将其部署到不同布局、状态和约束中,然后为每个控件生成基于真实状态的任务。日期选择器世界将一个日期控件渲染为10个上下文中6种核心组件,并预留了10个全新的未见过的组件,从日历热力图到滚轮和财年季度选择器;其最难任务将转录转化为推理,将“2026年1月的最后一个星期四”或“开始日期后的10个工作日”解析为一个精确且可由组件访问的日期。嵌套筛选世界则对20种组件家族进行变化,并预留9种复合面板家族作为分布外样本,根据筛选结果是否真正满足请求条件来评分,判断依据是应用自身的逻辑而非外观。
图4:两个技能覆盖的所有组件家族,分为训练(分布内)和仅评估(预留)部分:嵌套筛选,20个家族加9个预留复合面板;日期选择器,10个上下文中6种核心类型加10个预留组件。
图5:跨领域主题的日期选择器和嵌套筛选:嵌套筛选覆盖六个垂直领域,从房地产到宠物收养;日期选择器覆盖十个上下文,从日程安排到保险。
更深入、更针对性的世界带来的变化
更多轨迹并不自动提供更多的训练信号。关键在于深度:一个事件是否通过真实工作流程的依赖步骤执行任务,而非仅仅孤立地重复某个动作。两个实验从相反的两端使这一差异具体化:一个在完整领域中深入,另一个则聚焦于单一故障技能。
浅层世界适得其反;深层世界实现迁移
浅层世界是低成本的选择。它搭建迅速且看似合理,但仅模拟了孤立的、看似正确的点击操作。在这样的环境中训练模型会导致其形成错误的反射机制,出现过度操作、循环重复无效动作等行为,因为在简单的世界中从未对这些行为进行过惩罚。深层世界成本更高,但其轨迹包含了能迁移到实际场景中的依赖结构。
为验证这一点,我们选取两个真实WebVoyager领域(Allrecipes和Hugging Face),比较三个检查点:基础模型以及分别在浅层世界和深层世界轨迹上训练的两个模型。浅层世界设置的是简短且自包含的任务;深层世界设置的是需要跨多个依赖步骤完成的任务,早期操作会改变后续可用的状态、选项和验证方式。所有模型都获得相同的领域曝光量,仅深度存在差异,评估使用来自公开WebVoyager基准测试的任务,在训练世界之外的真实网站上运行。
在Allrecipes领域,浅层世界使模型性能下降,从80.0%降至75.0%;在Hugging Face领域则保持在48.0%不变。只有深层世界提升了性能,将Allrecipes提升至85.0%,将更难的Hugging Face任务提升至65.0%。在保持曝光量相等的情况下,差距源于深度:深层模型循环更少,37个Hugging Face任务中耗尽步骤预算的任务数量从15个减少到9个。区分两者的关键不在于模型看到了多少内容,而在于所见内容是否保留了工作结构。
图6:两个真实WebVoyager领域的浅层与深层世界对比,领域曝光量相同但任务深度不同。深层世界提升了两个领域的性能;浅层世界在Allrecipes上低于基础模型,在Hugging Face上则停滞不前。
对单一技能的精准提升
日期选择器和嵌套过滤器世界精准训练了我们评估中标识的控件,两项技能相互强化。日期选择器训练提升了日期选择器评估(分布内从60.0%提升至82.6%,未见过的布局从34.0%提升至54.0%);过滤器训练提升了未见过的过滤器评估(从62.8%提升至84.1%)。在从未训练过的表单上保持提升效果表明模型学习的是规则而非特定布局。这些技能相互迁移而非竞争:单独训练任一技能仍能提升另一技能,同时训练两者在所有数据集上都是表现最佳的全能方案。与GPT-5.4这一前沿基准对比,该组合模型在嵌套过滤器上已超越基准,并在日期选择器分布内差距上缩小了大部分,仅在未见过的日期选择器任务上仍存在明显差距。该规则已扩展至开放网络,使Online-Mind2Web在从未见过的网站上提升了29.5%至34.3%。
图7:针对性训练带来针对性提升:训练日期选择器或嵌套过滤器都能提升两者控件,包括未训练过的控件和组合,同时训练两者在所有数据集上都是表现最佳的全能方案。数值越高越好。
从合成世界到真实网络
本节其余部分涉及三个模型。基础模型是仅获得少量合成轨迹的Qwen3.5-9B,这些轨迹数量刚好足够将通用模型对齐到浏览器操作空间。我们的模型是使用完整合成语料库训练的同款90亿参数网络。GPT-5.4是一个远超规模的前沿模型,作为参考上限包含在内。
技能能否在开放网络中存活?我们对模型未作任何改动,直接在WebVoyager和Online-Mind2Web基准测试中进行评估,这两个基准测试从未参与过模型训练。它们与我们构建的内容重叠极少:两者主要由开放的公共网站和以阅读为主的浏览行为构成,而我们的训练环境则专注于需要登录的、以写入为主的流程。我们从未追求大幅跃升,而是关注方向。冻结模型在两个基准测试中均超过基准线,WebVoyager从66.5%提升至71.5%,Online-Mind2Web从40.5%提升至43.4%(不使用BrowserBase时,分别为50.9%至55.6%和29.5%至37.2%)。这些数据通过BrowserBase报告,因为托管浏览器能够消除数据中心的机器人拦截和速率限制,这些限制通常会压低所有代理的得分。由于混合数据中没有实时网络数据,这属于迁移学习而非记忆。
图8:合成训练迁移到实时网络。在两个从未参与训练的基准测试中,完整语料库模型均超过基准线;得分通过BrowserBase处理以消除数据中心的机器人拦截。
实时网络的微小提升是覆盖效应而非上限:瞄准实时域名时,提升会继续增长。我们的代码托管环境EchoForge与GitHub同属一类应用,而GitHub正是WebVoyager测试的实时网站之一。将EchoForge加入训练集后,实时GitHub得分从58.5%提升至63.4%,整体实时得分也同步上升(WebVoyager从50.9%提升至52.9%,Online-Mind2Web从29.5%提升至31.1%)。平均值仅反映我们构建的大部分内容位于这些基准测试从未触及的领域。
图9:按环境缩小与前沿的差距。绿色条形表示从基准模型到我们的模型的提升;淡色部分表示与GPT-5.4仍存在的差距。我们的模型在EchoBank和嵌套过滤器上超越GPT-5.4,并在其他环境中缩小了大部分差距;每个模型的具体得分标注在右侧。
我们构建的大部分领域(多数为封闭且需要登录的环境)讲述的是相反的故事。在全部14个领域中,模型几乎将基准线翻倍,从36.5%提升至67.1%,在基准线最弱的领域,提升幅度达到3至9倍。EchoCalendar、EchoML、EchoChat、EchoCare、EchoForge和EchoForum均从个位数或低两位数提升至40%至60%。这使得一个90亿参数模型在平均性能上距离GPT-5.4仅差14个百分点(67.1%对比80.7%)。在EchoMail、EchoBank和嵌套过滤器上,我们的模型直接匹配甚至超越了远超规模的前沿模型,仅在分布内日期选择器上落后几个百分点。让一个9B模型达到如此接近的程度的并非规模,而是深度、针对性且可验证的训练数据,这正是工厂设计用来生成的内容。
扩展带来的收益与局限
我们分别扩展了两个维度:在固定环境集合中增加轨迹数量(每个环境抽取相同数量的样本),以及增加更多不同的环境。它们的表现方式不同。在相同环境中增加轨迹数量持续提升领域内平均表现,但提升幅度逐渐缩小,而迁移到实时网络的表现则完全停滞:从6,400到20,000条轨迹,WebVoyager保持稳定(54.8%至55.6%),Online-Mind2Web反而下降(40.1%至37.2%)。由于每个样本点都均匀抽取自所有环境,这并非数据偏差:每个环境仅能提供有限的可迁移技能,一旦模型提取完毕,更多轨迹主要只是优化已有能力。
扩展环境产生的效果恰恰相反。随着广度增加,平均表现持续上升,而WebVoyager只有在使用完整数据集时才能发挥最佳性能。在泛化能力方面,关键因素是多样性而非数量。模型通过跨多种类型任务的训练,能够访问从未见过的网站,而不是通过重复训练单一类型任务。
即便如此,规模本身在两个维度上都不是关键因素。如果将大量轨迹预算投入到浅层世界,或在错误答案上进行评估,只会提升合成指标却无法在真实网络中取得进展。真正起作用的是轨迹内部的内容:保持真实工作流的深度、针对智能体失败控制点的精准训练,以及基于数据库的评估体系来确保信号的真实性。
图10:两个扩展维度的评估结果(未使用BrowserBase)。左图:在固定世界集合中增加轨迹数量,每个世界按相等数量抽取,x轴按实际轨迹数量间隔。合成指标持续上升,但真实网络迁移效果达到饱和,WebVoyager保持平稳,Online-Mind2Web在超过6,400条轨迹后开始下降。右图:增加环境多样性,合成指标和WebVoyager表现持续提升。环境多样性而非轨迹数量,才是将技能迁移到新网站的关键。
模型并非唯一的学习者
智能体获得的评分永远不只是模型本身的表现。它来自一个耦合系统:智能体、环境、任务和验证器。零分可能意味着智能体失败,也可能意味着控制逻辑损坏、请求状态不可达,或者验证器检查了错误的内容。将每个零分都视为模型监督,会导致在本应修复的缺陷上持续训练。因此,我们将每个评估轨迹视为对整个系统的测试,并让整个系统共同学习。当环境中的错误控制和连接被修复时,环境会得到改进;当任务目标被重新定义并增加难度时,任务会得到优化;当验证器与数据脱节时,验证器会进行修正。只有那些经受住这三重检验的失败案例,才会成为模型训练的课程内容。
EchoStay使这一现象变得清晰可见。其失败案例指向环境而非智能体:客房计数控制逻辑的静默失效导致预订任务无法完成,正确的预订永远无法被系统识别。修复该问题后,可完成预订的比例从48%提升至78%,成功解封了24个被阻断案例中的15个。同样的机制在其他场景中发现不同问题:EchoForum需要前端修复和页面加载速度优化,使37个任务中从0个解决提升至36个;EchoChat的验证器与数据脱节,重新校准后可评估任务比例从34%提升至99%;EchoCare需要一个状态连接修复;EchoForge拥有后端逻辑但缺少UI控制接口。
随着环境质量的提升,模型能力也随之增强。在EchoStay上进行两轮迭代测试,模型在该语料库上的训练效果超过翻倍,从16.2%提升至38.5%,达到GPT-5.4的50.4%的三分之二距离。模型并非唯一的学习者;当其下的所有系统都完成学习后,模型才会产生复利式提升。
图11:协同进化提升EchoStay模型性能。当环境从v1升级到v2时,基于该环境训练的模型效果提升超过两倍,从16.2%提升至38.5%,这是与环境自身解决率独立的另一个评估指标。数值越高表示表现越好。
在受控环境中,修复世界与训练模型之间的界限很容易保持,因为两者都可以被检查。但实时网络抹去了这一界限:任务进行中没有可供修复的世界,因此当某个动作作用于空无一物时,正确性完全取决于智能体能否察觉并选择不同的行为。这是世界最后需要教授的内容,也是实时网络最不宽容的地方。
从SFT到RL:将世界转化为RLEs
迄今为止的所有成果都源于模仿学习:9B模型复制了GPT-5.4正确的轨迹。但模仿学习存在上限:干净的示范从不展示如何从错误中恢复或何时停止,而这些正是在真实世界中导致智能体失效的失败场景。强化学习则优化我们评估的最终结果,让模型从自身轨迹中学习,而非依赖教师的指导。
但强化学习需要一个可大规模驱动的RL环境(RLE)。每个模拟运行都需要重置到已知状态、支持并行采样、具备可信赖的奖励机制,并且能够重复执行相同任务数千次。实时网络并非RLE:它不会重置,因此任何两次模拟运行的起始状态都不相同;它会在强化学习规模达到之前就限制和阻断自动化流量;它不提供任何真实答案,只提供每秒一个需要第二个模型判断的截图,因此奖励的噪声程度与评判者相当,策略反而会学习评判者的盲区而非任务本身。Echoverse通过其构造本身就是一个RLE。每个世界都是一个自包含的应用程序,我们对其进行快照并在每次模拟运行时重置,平行运行并从自己的数据库中评分,因此筛选SFT数据的验证器能返回基于真实数据的可验证奖励,而非通过像素推断得出的奖励。用于评估智能体的相同世界也用于训练智能体。
图12:在Echoverse RLE上的强化学习。从SFT策略出发,我们在一个世界中展开一组轨迹;每条轨迹都是改变数据库的一系列动作和执行步骤。评分器(与筛选SFT数据的验证器相同)位于环境外部,对每个模拟运行的最终数据库状态进行评分并生成奖励。这些奖励更新策略,训练过程在所有训练世界中重复进行。
我们将SFT模型作为初始策略,针对五个世界运行强化学习:EchoBank、EchoForge、EchoForum、EchoStay和EchoTunes。任务选择每个世界中更具挑战性的部分,这些部分SFT策略仍有改进空间,每次更新都基于多个评分后的模拟运行。每次模拟运行获得两种奖励:一种来自我们基于数据库的验证器(LLM评判者GPT-4.1)的轨迹奖励,另一种来自多模态评判者(GPT-4.1视觉)的每步密集奖励。我们在每个世界中SFT数据之外训练约100个任务,进行两轮训练。在每个世界保留的25个任务测试集中,评判得分从58%提升至69%。教师教会了它该做什么;世界教会了它何时停止、何时恢复、何时放弃。
图13:在五个世界上的强化学习,跨越两轮训练。左图:每个世界保留的25个任务的评判得分(25个任务/世界)从58%提升至69%。右图:评判者的平均得分(强化学习奖励信号)在训练过程中持续上升。奖励综合了我们基于数据库的验证器(LLM评判者GPT-4.1)提供的轨迹奖励,以及多模态评判者(GPT-4.1视觉)提供的每步密集奖励。
当前进展
世界不再是衡量模型表现的固定基准,而是一个持续改进的训练表面,其中用于评估模型的分级测试同样提升了评判它的环境。深度世界在浅层克隆拉低能力时实现迁移;一个组件以百种形式重建,教会了能触达真实网络的技能;协同进化同时推动了双方;而对同一世界的强化训练使智能体超越模仿,提升了保留集表现并减少了无效步骤。
持久优势并非拥有最多合成网站的库存,而是一座工厂:它能诊断智能体尚未掌握的能力,构建或修复教学环境,保护已获得的能力,并重复运行循环。下一步将同时扩展三个方向:首先,为封闭领域基准无法触及的场景创建更多深度世界;其次,为交互模型持续失败的场景构建更多能力世界;最重要的是,对这些真实世界进行更强烈的强化训练:更长的运行时长、更难的任务以及更广的奖励探索,将智能体的行为和性能推向模仿无法企及的境界。杠杆效应不断累积:更深更广的世界带来更强的强化学习,更强的强化学习提升智能体,而每一轮循环都会暴露下一个待构建的能力。
我们发布了工厂的一部分:四个世界的环境代码和分级测试任务,包括两个深度领域(EchoStay 和 EchoForge)和两个能力世界(日期选择器和嵌套筛选器,每个世界都包含一个分布内和一个保留集划分)。每个任务都带有基于数据库的评分器,因此这些世界既能作为智能体的评估基准,也能用于训练智能体。代码和任务:https://aka.ms/echoverse
当世界在智能体能力的前沿不断扩展时,评估不再只是记分牌,而成为决定下一步构建内容的引擎:那些能与训练智能体同步学习的世界。
致谢
感谢 Alexey Taymanov、Andrew Zhao、Aravind Rajeswaran、Corby Rosset、Hussein Mozannar、Luiz Do Valle、Sara Abdali、Spencer Whitehead、Vibhav Vineet、Zach Nussbaum、Yadong Lu、Pashmina Cameron、Rafah Hosn 和 Chinmay Karkar 在本工作全程提供的宝贵帮助、深入讨论和持续支持。
相关出版物
Card
Echoverse:用于大规模训练计算机使用智能体的深度、动态环境
作者介绍
Card column wrapper
Card body
Akshay Nambi
首席研究员
Card footer
了解更多
Yash Pandya
高级研究工程师
Sahil Gupta
研究实习生
Sarthak Harne
研究研究员
Archana Yadav
软件工程师 2
Kavyansh Chourasia
研究软件开发工程师 2
Yash Lara
高级项目经理
Ahmed Awadallah
合作伙伴研究经理
Ece Kamar
人工智能前沿首席副总裁兼实验室主任
研究领域
- 人工智能