量子位

让Agent越用越强:AReaL 2.0开源,打造面向自演进智能体的RL基础设施

6.7内容质量

TL;DR · AI 摘要

让Agent越用越强:AReaL 2.0开源,打造面向自演进智能体的RL基础设施 – 量子位 扫码关注量子位 <div class="top search" <form role="search" method="get" class="s...

核心要点

  • 主题聚焦:让Agent越用越强:AReaL 2.0开源,打造面向自演进智能体的RL基础设施
  • 来源:量子位,建议结合原文判断细节。
  • AI 分析暂不可用,本条为保底评分与摘要。
#AI#编程#云计算#安全#开源
打开原文

让Agent越用越强:AReaL 2.0开源,打造面向自演进智能体的RL基础设施 – 量子位

扫码关注量子位

<div class="top_search"> <form role="search" method="get" class="search-form" action="https://www.qbitai.com/" id="search"> <label> <input type="search" class="search-field" placeholder="搜索…" value="" name="s"> </label> <button type="submit" class="search-submit"></button> </form> </div>

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

articlead begin

articlead end

让Agent越用越强:AReaL 2.0开源,打造面向自演进智能体的RL基础设施

量子位的朋友们

2026-07-02

19:28:36

来源:

量子位

摘要样式

与社区共同推进自演进智能体生态发展

7 月 2 日,开源强化学习基础设施项目 AReaL 正式发布 2.0 版本。AReaL 旨在打通基础模型训练与现代智能体应用之间的链路,为 Agent 应用场景提供高效的强化学习训练支撑。

此次发布的 AReaL 2.0 版本面向已经进入真实业务场景的 Agent,提供了一套让 Agent 在使用中持续学习的系统基础设施。通过 AReaL 2.0,Agent 在完成真实任务时产生的交互过程,可以被记录、整理,并接入后续训练流程,用于持续优化底层模型,从而让 Agent 在安全可控的前提下越用越强。

如今,Agent 正在进入真实生产环境,写代码、查资料、调用工具,在企业系统中完成越来越复杂的任务。但一个问题也随之出现:Agent 每天都在工作,却很难从工作中真正成长。

在真实业务中,Agent 会产生大量有价值的经验:哪些任务完成得好,哪里调用工具失败了,用户为什么不满意,某一步决策是否走错了方向。但是,这些信息大多只是以日志形式被保存下来,很难稳定、安全地转化为下一次能力提升。

AReaL 2.0 要解决的,正是 Agent 上线之后如何继续成长的问题。开发者不需要重新开发 Agent,只需让 Agent 原本发给大模型的请求经过 AReaL 2.0 的统一推理入口,就可以接入在线强化学习流程。

图说:AReaL 2.0 在线强化学习(Online RL)架构示意

以 Hermes Agent 为例,Hermes 仍然照常接收任务、规划步骤和调用模型,AReaL 2.0 则在后台记录它完成任务时的关键交互过程,并结合任务结束后的反馈或奖励信号,把这些真实轨迹用于后续训练。开发者也可以把 Hermes 替换成自己的 Agent 和任务环境,用同样的方式搭建 Agent 在线强化学习流程。

这意味着,Agent 的能力提升不再只依赖人工构造数据、离线训练和重新部署。真实任务中的多轮对话、工具调用、执行结果和反馈信号,都有机会成为模型继续学习的材料。

这一点在企业场景中尤其重要。在企业工作流中的 Agent 面对的是真实、复杂、不断变化的任务:代码库会更新,业务流程会调整,用户需求会变化,工具和系统也可能发生改变。如果 Agent 的能力一旦上线就基本固定,它就很难长期适应真实环境。AReaL 2.0 希望补上的,正是从“会使用工具”到“能从使用中学习”之间缺失的一环。

同时,真实业务中的持续学习也不能只是简单地“收集数据再训练”。Agent 可能接触代码、客户信息、企业知识库和内部系统,因此训练链路必须考虑权限控制、数据脱敏、隔离和审计等要求。AReaL 2.0 在系统设计中引入了面向 Agent 轨迹的数据代理机制,让真实任务数据进入训练流程时,可以在更安全、可控的前提下被管理和使用。

AReaL 团队在技术报告中指出,自演进 Agent 的关键瓶颈,不只是模型本身有多强,也不只是强化学习算法是否先进,而是缺少一套能够服务真实 Agent 的在线强化学习基础设施。AReaL 2.0 正是面向下一代智能体应用进行的架构升级:把 Agent 服务、真实任务轨迹、数据治理和在线强化学习训练连接起来,让 Agent 在部署之后继续学习具备了可落地的工程基础。

从更长远的角度看,AReaL 2.0 指向的是下一代智能体应用的演进范式:Agent 不再只是一次性训练和部署的工具,而是在真实环境中不断获得反馈,把成功和失败都转化为经验,并在安全边界内不断提升自身能力。

AReaL 项目由蚂蚁集团、清华大学和香港科技大学等团队于 2024 年发起。2026 年 5 月,AReaL 正式从蚂蚁 InclusionAI 孵化成为独立开源社区,并加入 PyTorch Foundation Ecosystem 项目,进一步融入主流强化学习基础设施生态。

随着社区独立发展,AReaL 也在持续获得产业和开源生态伙伴的参与和支持,包括华为云团队、MindLab 等。未来,AReaL 将继续围绕在线强化学习、自动化评估和多模态智能体训练等方向迭代,与社区共同推进自演进智能体生态发展。

目前,AReaL 2.0 技术报告和代码已开源。

  • GitHub 仓库: https://github.com/areal-project/AReaL
  • 技术报告: https://arxiv.org/abs/2607.01120
  • 本文由蚂蚁提供,量子位获授权转载,观点归原作者所有。

版权声明

版权所有,未经授权不得以任何形式转载及使用,违者必究。

AReaL

作者文章列表

  • WorldClaw与百度智能云达成战略合作,文心5.0系列登陆WorldRouter 2026-07-03
  • 科大讯飞举办智能交互生态发布会,三大平台同步升级 2026-07-02
  • 天工AI业务ARR突破8亿美元,向中国首个非BAT10亿美元ARR的AI公司迈进 2026-07-02
  • 天工 3.2 重磅升级:Skywork Tags 上线,给 Agent 一张工牌,邀其加入你的工作群聊 2026-07-02

左侧分享

扫码分享至朋友圈

相关阅读 start

相关阅读 end

热门文章 start

热门文章

#### Claude Fable 5分批重新上线!GPT-5.6秒跟

2026-06-26

#### 从需求到设计到代码,一个软件全搞定!TRAE Work Design实测来了

#### WAVES 2026:今年盛夏,在创投浪潮里,做迎风而立的少数人!

#### 谷歌「推理之王」也跑路Meta了,当年还是李飞飞挖来的

#### 两个月连获两轮数亿元融资 深度机智以全栈自主路线加速国产物理AI基座模型落地

<form role="search" method="get" class="search-form" action="https://www.qbitai.com/"> <label> <span class="screen-reader-text">搜索:</span> <input type="search" class="search-field" placeholder="搜索…" value="" name="s" /> </label> <button type="submit" class="search-submit"><span class="screen-reader-text">搜索</span></button> </form>

热门文章 end

底部版权

  • 关于量子位
  • 加入我们
  • 寻求报道
  • 商务合作

<a href="/?page_id=183"target="_blank"><i class="weixin_icon"></i></a>

追踪人工智能新趋势,报道科技行业新突破

<p>量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1</p>

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1