量子位

前字节强化学习专家孙鹏博士加盟星尘智能,完善Physical AI全栈技术布局

8.5内容质量

TL;DR · AI 摘要

星尘智能引进前字节强化学习专家孙鹏博士,强化机器人强化学习技术布局。

核心要点

  • 孙鹏博士拥有10余年强化学习与智能体研究经验,覆盖机器人、游戏AI及大模型领域。
  • 星尘智能构建了AI模型+具身OS+绳驱本体的全栈技术闭环。
  • 强化学习后训练技术将推动机器人实现真实环境中的持续优化。

结构提纲

按章节快速跳转。

  1. 机器人技术从Demo走向商业化,强化学习成为关键解决方案。

  2. ·孙鹏博士履历

    孙鹏深耕强化学习十余年,横跨机器人、游戏AI及大模型后训练领域。

  3. 星尘智能技术布局

    构建AI模型、具身OS与绳驱本体的全栈技术体系,强化后训练闭环。

  4. 强化学习与大模型技术结合,推动机器人实现真实环境持续学习。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 星尘智能技术布局
    • 核心团队
      • 孙鹏博士(强化学习专家)
    • 技术栈
      • AI模型(Lumo系列)
      • 具身OS(Philia)
      • 绳驱本体
    • 关键技术
      • 强化学习后训练
      • Latent World Dynamics

金句 / Highlights

值得收藏与分享的关键句。

  • 孙鹏博士曾研发《星际争霸》AI智能体TStarBots,在多智能体强化学习领域取得重要成果。

    第3段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 星尘智能Lumo-2模型引入Latent World Dynamics,在隐空间中预测未来世界并生成动作。

    第5段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 强化学习后训练技术可使机器人在真实执行和反馈中持续优化行为策略。

    第6段

    ⬇︎ 下载 PNG𝕏 分享到 X
#强化学习#机器人技术#星尘智能#AI模型
打开原文

前字节强化学习专家孙鹏博士加盟星尘智能,完善Physical AI全栈技术布局 – 量子位

扫码关注量子位

<div class="top_search"> <form role="search" method="get" class="search-form" action="https://www.qbitai.com/" id="search"> <label> <input type="search" class="search-field" placeholder="搜索…" value="" name="s"> </label> <button type="submit" class="search-submit"></button> </form> </div>

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

articlead begin

articlead end

前字节强化学习专家孙鹏博士加盟星尘智能,完善Physical AI全栈技术布局

量子位的朋友们

2026-09-02

14:06:50

来源:

量子位

摘要样式

9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中⼼负责⼈孙鹏博⼠正式加入星尘智能

9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中⼼负责⼈孙鹏博⼠正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。

过去两年,机器人基础模型主要在解决“会不会”。但随着机器人从 Demo 走向真实部署和商业化,问题正在转向“能不能稳定做好”。如何让机器人根据真实执行结果持续修正策略,也让强化学习重新回到行业关注的中心。

孙鹏长期深耕强化学习(RL)、智能体(Agent)及多智能体强化学习(MARL),拥有横跨机器人强化学习、大规模分布式 RL 系统与大模型强化学习的研究与产业实践经历。他的加入将进一步强化星尘智能在机器人强化学习方向的布局,并与 AI 模型、具身 OS 和绳驱机器人本体形成协同,推动机器人在真实世界中持续学习、不断进化。

据了解,孙鹏加入星尘智能后,继续扩充机器人强化学习团队,推动相关技术能力提升和应用部署。

从腾讯到字节 深耕强化学习十余年

孙鹏博士毕业于清华大学,此后先后在康奈尔大学和罗格斯大学从事博士后研究。过去十余年,其研究与产业实践始终围绕强化学习与智能体展开,并逐步从机器人强化学习拓展至大规模 RL 系统与大模型后训练,形成了兼具算法研究与系统工程的技术积累。

早期在腾讯 AI Lab 及 Robotics X 机器人实验室期间,孙鹏曾担任智能体中心负责人,开展深度强化学习与机器人控制研究。他曾利用深度强化学习和对抗博弈训练轮式机器人,实现端到端主动目标跟随;同时研发《星际争霸》AI 智能体 TStarBots、TStarBotX,在多智能体强化学习(MARL)复杂博弈环境研究中取得重要成果。

加入字节跳动后,孙鹏将其技术实践由算法全面拓展至大规模 RL 系统工程。他主导开发了核心强化学习基础设施 ByteRL,支撑多款自研游戏 AI 的高效训练。其团队曾夺得 IEEE CoG 2023 策略卡牌 AI 竞赛冠军,研发的《炉石传说》AI 展现出击败行业顶尖选手的竞技水平。

随着大语言模型兴起,孙鹏进一步将强化学习积累拓展至LLM 后训练。在字节 AI Lab/ByteResearch 期间,他作为项目负责人参与研究并发布强化微调方法 ReFT(Reinforced Fine-Tuning)及数学推理智能体 DeltaProver;在 Seed 团队深度参与模型 RLHF 与预训练,在模型对齐、推理增强及 Agent 方向积累了深厚的前沿探索经验。

从机器人强化学习,到大规模 RL 系统,再到大模型后训练,孙鹏过去十余年的技术路径,始终围绕一个核心问题展开:如何让智能体通过环境交互与反馈不断学习,并持续优化自身策略。如今,随着 AI 从数字世界进一步进入真实物理世界,这套能力也正在具身智能领域找到新的落点。

履新星尘智能 加码机器人后训练闭环

对于星尘智能而言,在推进“AI模型+具身OS+绳驱本体”全栈技术体系建设的同时,孙鹏的加入正是夯实机器人模型“训练之后”的关键一环。

从成立之初,星尘智能就坚持Design for AI,认为机器人身体、数据与AI模型不应被割裂设计。过去几年,这套思路已经逐步形成覆盖基座模型和商用模型、前端共生Agent、强化学习后训练的完整闭环。

星尘智能的基座模型Lumo系列,持续推进机器人对环境与动作的理解、预测和生成,其中Lumo-1让机器人理解动作背后的“为什么”,Lumo-2作为首个家庭隐式世界动作模型,率先引入 Latent World Dynamics,在隐空间中先预测未来世界,再生成动作;前端的Agent Philia,面向长期记忆、任务管理、多机器人协同与自然交互;而强化学习作为基础模型走向规模化真实部署的重要环节,承担了机器人如何从真实环境中的持续交互与任务反馈中学习,并不断优化自身的行为策略的关键命题。

孙鹏在机器人强化学习、大规模 RL 系统以及大模型 RLHF、强化微调和 Agent 方向的长期积累,将进一步强化星尘智能在这一环节的技术能力。未来,他将参与星尘具身模型、机器人强化学习及后训练体系建设,探索大模型时代已经被验证的强化学习后训练方法,如何进一步与真实机器人执行、数据闭环和长期部署结合。

对于此次加入星尘智能,孙鹏表示:“过去十多年,我一直在做强化学习和智能体,也亲历了强化学习从机器人控制、复杂博弈走向大模型后训练的过程。现在,我很希望把这些积累真正带回物理世界。星尘智能已经具备从机器人本体、具身 OS 到 AI 模型的完整技术基础,接下来最让我期待的,是和团队一起把强化学习进一步融入真实机器人的训练与部署,让机器人不只是‘学会一个任务’,而是能够在一次次真实执行和反馈中,把任务越做越好。”

本文由星尘智能提供,量子位获授权转载,观点归原作者所有。

版权声明

版权所有,未经授权不得以任何形式转载及使用,违者必究。

星尘智能

作者文章列表

  • SkyProduction天工工作台:从剧本到成片,一套工作台把精品短剧创作真正跑起来 2026-09-02
  • 还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍 2026-09-02
  • 阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一 2026-09-02
  • 香港首个真实开放场景服务机器人落地兰桂坊 2026-09-02

左侧分享

扫码分享至朋友圈

相关阅读 start

相关阅读

#### 人形机器人「星尘智能」获数千万美元Pre-A轮融资,经纬创投领投

星尘智能于2022年12月在深圳成立,专注研发“新一代最强AI机器人助理”

鱼羊

2024-07-31

AI机器人

#### 国产AI机器人好超前…弹琴泡茶打咏春,还能撸猫??

Figure CEO都赶紧来围观

明敏

2024-08-19

人形机器人

具身智能

相关阅读 end

热门文章 start

热门文章

#### 神秘「牛来」模型果然是智谱!GLM首个原生多模态,还用的国产卡

2026-08-27

#### 工业Agent不是“套壳”大模型!西门子百年经验灌进工业AI

#### 小宇宙推出《AI趋势报告》:AI创作、AI办公、协作型AI等成讨论新趋势

2026-08-26

#### Claude开始接管物理世界!能用机械臂阻拦5000万美元打款了

2026-08-28

#### 智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持

<form role="search" method="get" class="search-form" action="https://www.qbitai.com/"> <label> <span class="screen-reader-text">搜索:</span> <input type="search" class="search-field" placeholder="搜索…" value="" name="s" /> </label> <button type="submit" class="search-submit"><span class="screen-reader-text">搜索</span></button> </form>

热门文章 end

底部版权

  • 关于量子位
  • 加入我们
  • 寻求报道
  • 商务合作

<a href="/?page_id=183"target="_blank"><i class="weixin_icon"></i></a>

追踪人工智能新趋势,报道科技行业新突破

<p>量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1</p>

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1