Orchard: An open framework for scalable agentic AI

TL;DR · AI 摘要
微软发布Orchard开源框架,通过Orchard Env环境服务支持多领域智能体训练,30亿参数模型在SWE-bench测试中达到69.7%性能。
核心要点
- Orchard框架支持软件工程、网页导航等多类型智能体训练
- Orchard-SWE使用30亿参数模型实现SWE-bench 69.7%准确率
- 框架提供真实部署环境Codex/OpenClaw/ZeroClaw的集成支持
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Orchard框架
- 核心组件
- Orchard Env(Kubernetes环境服务)
- 跨任务领域支持
- 应用场景
- 软件工程智能体
- 网页导航智能体
- 个人助理智能体
- 技术指标
- 30亿参数模型
- SWE-bench 69.7%准确率
金句 / Highlights
值得收藏与分享的关键句。
Orchard-SWE使用30亿参数模型在SWE-bench Verified测试中达到69.7%准确率
Orchard Env支持软件工程、网页导航、个人助理等多类型智能体系统
框架提供Codex/OpenClaw/ZeroClaw等真实部署环境的集成支持
Orchard:一个用于可扩展智能体AI的开源框架 - 微软研究院
/.itemprop=publisher
/itemprop=image
Orchard:一个用于可扩展智能体AI的开源框架
发布于2026年8月3日
作者:Baolin Peng,首席研究经理 Wenlin Yao,首席研究员 Qianhui Wu,高级研究员 Hao Cheng,首席研究员 Jianfeng Gao,技术专家&公司副总裁
分享此页面
- 在Facebook上分享
- 在X上分享
- 在LinkedIn上分享
- 在Reddit上分享
- 订阅我们的RSS源
/#single-header
一目了然
- Orchard 是一个开源框架,旨在支持可扩展且成本效益高的智能体AI研究,其核心是 Orchard Env——一个可复用的环境服务,用于在不同任务领域中训练和评估智能体。
- 同一Orchard基础设施可支持软件工程、网页导航和个人助理智能体,并能直接在真实部署环境中(如Codex、OpenClaw和ZeroClaw)进行训练,使研究人员能够在不同任务中复用环境、数据管道和评估流程。
- Orchard-SWE、Orchard-GUI和Orchard-Claw展示了相对较小的开源权重模型在复杂现实任务中也能取得优异表现。例如,Orchard-SWE在SWE-bench Verified基准测试中达到69.7%(通过价值模型重新排序达到73.0%),仅使用约30亿活跃参数,接近使用超过10倍规模模型的前沿系统。
除模型和工作流程外,该项目还发布了训练数据和评估方法,旨在帮助更广泛的研究社区构建和研究开放智能体系统。人工智能正迅速从静态问答转向能够跨复杂多步骤环境进行规划、推理和行动的自主智能体。这些系统可以修复复杂代码库中的错误、代表用户浏览网页以及管理涉及日历和电子邮件的工作流程。
尽管人们对智能体AI的能力充满期待,但研究社区仍面临持续的瓶颈。构建最先进的智能体系统通常需要专有基础设施,包括定制沙盒、封闭训练管道和大多数研究人员和从业者无法访问或复现的专有数据集。
为解决这一问题,我们推出了Orchard(在新标签页中打开),一个用于可扩展智能体建模的开源框架。Orchard的核心是Orchard Env,这是一个轻量级的Kubernetes环境,提供可复用的隔离组件,用于大规模运行和构建智能体——从收集训练数据到强化学习部署和评估。
与许多现有框架不同,Orchard Env的设计支持不同智能体系统和任务类型,无需修改。同一服务可跨领域支持软件工程智能体、网页浏览智能体和个人助理智能体。
为证明这一方法,我们发布了三个特定领域的训练方案——Orchard-SWE、Orchard-GUI和Orchard-Claw。(在新标签页中打开)我们还发布了用于构建它们的训练数据和评估方法。
视频系列
再思
由Sinead Bovell制作的视频系列,围绕人们关于AI的普遍问题展开。我们邀请微软各领域的专家,解析这项快速变化技术的潜力与挑战,探讨正在演变和可能实现的未来。
探索该系列
/.msr-promo__content
/.msr-promo__inner-wrap
在新标签页中打开
/.msr-promo
可跨任务类型扩展的环境层
Orchard 的核心理念是运行时环境应作为独立且可重复使用的服务,而非嵌入在特定训练框架中的基础设施。Orchard Env 基于 Kubernetes 架构,能够并行创建、管理和移除数千个隔离组件。
该系统设计用于跨多种任务协同工作,包括编码、网页浏览和工具使用。同时,系统也支持跨不同智能体系统运行,并贯穿训练和评估过程的各个阶段,包括数据蒸馏和强化学习部署。
这种灵活性使 Orchad 在研究规模上具备实用性。团队可以引入新的基准测试、智能体系统或训练算法,而无需从零开始重建底层基础设施。
Orchard 还实现了在任意工具链中训练智能体。当前最先进的智能体很少以裸模型形式运行,而是通过复杂的工具链(如 Claude Code、Codex 和 OpenClaw)进行操作,这些工具链能够管理多轮推理、工具使用以及与外部系统的连接。现有的开源训练工具通常无法处理这些有状态的多进程工具链,迫使研究人员在简化的模拟环境中进行训练,然后再部署到真实场景,从而产生不匹配问题。Orchard 解决了这一问题:轻量级代理会记录工具链自身的模型调用作为训练数据,每个部署都在独立容器中运行,使智能体可以直接在其部署时使用的工具链(如 OpenClaw、Codex、ZeroClaw 或其他工具链)中进行端到端训练,并跨多个工具链进行训练。
Orchad-SWE:推进开源软件工程智能体
软件工程是自主智能体最具挑战性的应用场景之一。它需要对真实代码库进行多步骤推理、工具使用以及从错误中恢复的能力。Orchard-SWE 是我们针对该领域的训练流程。该系统基于 Mini-SWE-Agent 框架构建,该框架旨在自主解决软件工程任务,并在广泛使用的 SWE-bench Verified 基准上进行评估,该基准测试模型导航、诊断和修复真实世界代码库的能力。
为了训练系统,我们从两个先进的开源权重模型(MiniMax-M2.5 和 Qwen3.5-397B)中蒸馏了 107,000 次智能体交互,这些交互覆盖了广泛的 GitHub Issues。训练过程使用信用分配监督微调方法:系统不会丢弃智能体未能完全解决问题的尝试,而是从这些部分尝试的有成效部分进行学习,从而增加模型可用的有用训练数据量。
接下来是强化学习,但其反馈较为稀疏——智能体通常只能学习其最终补丁是否通过或失败隐藏测试的结果。我们首先采用平衡自适应部署方法,充分利用这些罕见的成功信号,然后添加两种"密集奖励"技术以提供更丰富的指导:策略蒸馏(由更强的教师模型逐步评分智能体决策)和过程奖励模型(由人工智能法官对合理的解决问题过程进行奖励,包括编写重现错误的测试、验证修复方案以及检查现有行为是否仍正常运作,而与最终测试是否通过无关)。
最后,我们基于过去的轨迹数据训练一个价值模型,对候选解决方案进行重新排序。强化学习会生成大量通常被丢弃的实践轨迹;相反,我们利用20次先前实验的轨迹数据,训练了一个参数量仅为40亿的紧凑价值模型,该模型能够识别高质量解决方案。在解决问题时,该模型会对多个候选答案进行评分并选择最优解。结合这些技术,Orchard-SWE在SWE-bench Verified基准测试上的表现从61.4%的基线提升至使用平衡自适应轨迹扩展的69.1%,以及使用密集奖励技术的69.7%——这在同等规模(约30亿活跃参数)的开源模型中创造了新的最先进水平,通过价值模型重新排序后更进一步达到73%,接近规模超过其10倍的前沿系统,如图1所示。
Orchard-GUI:用于现实网络任务的轻量级浏览器代理
网络导航面临不同的挑战。代理需要解析视觉布局、与动态界面交互,并完成仅用自然语言描述的开放任务。
Orchard-GUI通过相对少量的监督训练了一个40亿参数的视觉-语言模型作为浏览器代理:400个蒸馏演示示例结合2200个开放训练任务。尽管训练数据有限,该模型在多个网络导航基准测试中表现强劲:在WebVoyager上达到74.1%,在Online-Mind2Web上达到67.0%,在DeepShop上达到64.0%,平均为68.4%(如图1所示)。
图1. 性能对比。左图:Orchard-SWE(35B-A3B,约30亿活跃参数)在SWE-bench Verified上达到69.7%——通过价值模型重新排序后达到73%——与规模超过其10倍的前沿系统相当。右图:Orchard-GUI(40亿参数)在WebVoyager、Online-Mind2web和DeepShop三个基准测试中平均成功率达到68.4%,成为最强的开源GUI代理,其表现与OpenAI和Google的专有系统相当。
这些结果使Orchard-GUI成为目前最强的开源网络代理之一,同时仍能与更大的专有模型保持竞争力。结果还表明,通过正确的训练方法和环境,小型开源模型也能在现实网络任务中表现出色。
Orchard-Claw:用于日常生产力的个人助理代理
许多最具影响力的智能代理应用涉及日常生产力任务,包括阅读和撰写电子邮件、管理日历、搜索信息以及跨工具协调。Orchard-Claw专注于个人助理任务,仅通过200个合成任务训练代理。在覆盖现实生产力工作流的Claw-Eval基准测试中,该模型在最多三次尝试下成功完成59.6%的任务。当与更强大的ZeroClaw代理系统结合时,成功率提升至73.9%。
由于Orchard可以直接在真实部署框架中训练代理,Orchard-Claw在多个框架中进行训练——包括ReACT、ZeroClaw、OpenClaw和Codex——而非单一简化循环。在这些真实框架中进行训练显著提高了代理的可靠性;例如,在Codex框架下,其成功率从未训练模型的18.6%提升至经过Orchard训练后的51.5%。
Figure 2. Orchard框架概览。Orchard Env(中心)是一个轻量级、原生支持Kubernetes的环境服务,提供沙箱管理、命令执行、文件访问、网络控制、REST API和代理集成等共享能力。它支持多种任务环境(底部行),并应用于三个任务领域(顶部行):Orchard-SWE(软件工程)、Orchard-GUI(浏览器导航)和Orchard-Claw(AI个人助手)。
意义与未来方向
Orchard的研究成果强调了一个更广泛的观点:环境层至关重要。通过将底层基础设施开放、轻量化并实现复用,Orchard降低了智能体AI研究的成本。团队不再需要从零开始构建定制的隔离环境,或依赖专有的云服务。相同的Orchard Env可用于生成训练数据、运行强化学习迭代以及评估最终模型,而无需每次重建系统。
展望未来,我们看到复用训练经验是实现累积式智能体学习的有前景方向。训练运行结束后,我们不再丢弃轨迹数据,而是将其视为持久资产——例如提炼为可复用的价值模型。这使智能体经验能够随时间积累,让新一代智能体继承并扩展前代获得的知识,而非从零开始。
Orchard-GUI展示的数据效率表明,大规模网络智能体可能无需大量人工创建的训练数据即可训练。通过发布完整的Orchard技术栈(包括环境服务、训练流水线和训练数据集),我们希望帮助更广泛的研究社区更快构建更强大的开源智能体。
致谢
感谢微软研究院及合作机构的团队对Orchard的贡献,以及开源社区提供的基准和工具,使这项研究成为可能。
作者介绍
Card column wrapper
Card
Card body
逄宝林
首席研究经理
Card footer
了解更多
姚文林
首席研究员
微软研究院
吴倩慧
高级研究员
程浩
首席研究员
高建华
技术院士兼公司副总裁
研究领域
- 人工智能
/