Google DeepMind Blog

Gemini Robotics 2 brings whole body intelligence to robots

8.5内容质量
Gemini Robotics 2 brings whole body intelligence to robots

TL;DR · AI 摘要

Google DeepMind发布Gemini Robotics 2,实现机器人全身智能控制与多机协作,通过三大模型突破传统机器人局限。

核心要点

  • Gemini Robotics 2支持从脚到指尖的全身智能控制,可完成复杂环境任务。
  • ER模型实现多机器人协作与分钟级多步骤任务规划。
  • On-Device模型可在新机器人上实现数小时快速适配。

结构提纲

按章节快速跳转。

  1. 介绍Gemini Robotics 2实现全身智能控制的核心价值。

  2. 解析VLA、ER、On-Device模型的技术分工与能力边界。

  3. 展示从家庭清洁到工业协作的典型用例。

  4. 说明模型在本地设备运行与跨机器人适配的实现方式。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Gemini Robotics 2技术架构
    • 核心技术
      • 全身智能控制
      • 多机器人协作
    • 模型体系
      • VLA模型
      • ER模型
      • On-Device模型
    • 应用价值
      • 家庭服务机器人
      • 工业自动化

金句 / Highlights

值得收藏与分享的关键句。

#机器人AI#Gemini Robotics 2#DeepMind#多模态模型
打开原文

2026年7月30日 模型

Carolina Parada

从脚到指尖——我们正在教会机器人实现智能全身控制、精细操作灵活性以及团队协作能力,以完成各种复杂的任务

数十年来,我们一直梦想着能够无缝融入人类世界并提供帮助的机器人。如今,这一愿景取得了重大突破。

目前大多数机器人仅针对特定的重复性任务序列进行预编程或远程操控。它们缺乏自主学习和适应不可预测环境的能力。此外,将已学习的技能从一种机器人身体转移到另一种机器人身体仍然极其困难。为了在大规模上解决最困难的问题,各种形状和尺寸的机器人都需要人工智能模型赋予它们思考、行动和智能交互的能力,以安全地完成任务。

我们曾通过 Gemini Robotics 展示了Gemini多模态理解如何驱动现实世界中的行动。今天,我们推出Gemini Robotics 2——这是下一代真正可适应机器人的智能核心。随着它迈出第一步,这项重大进展实现了智能全身控制、高级操作灵活性以及多机器人协作。

Gemini Robotics 2 使机器人能够对每个动作进行推理,从而解锁广泛的任务场景。例如,它可以指导人形机器人行走、蹲下、伸展并操作物体以清理杂乱的房间。它甚至可以与其他机器人协作以更快完成任务。这种深刻的智能还可以在设备本地运行,仅需数小时即可无缝适应全新的机器人身体。

我们通过以下三个高度先进的模型实现这一切:

  • Gemini Robotics 2:我们最先进的视觉-语言-动作模型(VLA),能够将视觉和语言输入转换为运动控制,使机器人能够采取行动。该模型能够控制从脚到指尖的完整人形机器人及其他双臂机器人。它还为双手和夹具带来了新的精细操作能力。
  • Gemini Robotics ER 2:我们最强大的具身推理(ER)模型。这是一个视觉语言模型(VLM),作为我们的智能体运行,使机器人能够与人类沟通、理解物理世界并规划持续数分钟的多步骤任务。我们还引入了机器人团队协作的能力。
  • Gemini Robotics On-Device 2:我们优化后效率最高的视觉-语言-动作模型(VLA),专为在机器人设备上本地运行而设计。该模型现在只需数小时的数据即可快速适应全新的机器人形态。

Gemini Robotics ER 2,我们的推理模型,现已在Google AI StudioGemini Enterprise Agent Platform的私有预览版中提供。我们的VLA和On-Device模型已向早期访问合作伙伴开放。了解如何将这些模型部署到您的硬件设备上,请访问我们的开发者博客

运动人形机器人:全身任务管理

世界是按照人类运动方式构建的;它要求我们在狭窄、杂乱的空间中进行抓取、弯曲和平衡。虽然我们之前的模型通过控制人形机器人的上半身来完成桌面任务,但Gemini Robotics 2将物理AI扩展到全身运动控制。

首次实现模型对完整人形机器人的控制,将意图转化为智能的全身控制。例如,在控制Apptronik的Apollo 2人形机器人时,我们可以要求它“将浇水壶放入底层货架的绿色垃圾桶中”。Apollo会处理指令,走到桌子旁拿起浇水壶,走到货架前,精准地将其放置在指定位置。尽管我们的机器人在运动速度方面仍有提升空间,但这标志着实现更复杂、需要全身协调的现实任务所需技能的重要进展。

为机械手和夹爪赋予高级灵巧性

要在家庭和工作场所真正发挥作用,机器人需要精细的操作能力。Gemini Robotics 2在不同末端执行器(无论是手还是夹爪)上实现了新的物理灵巧性水平,使机器人比以往任何时候都更有用。

该模型现在可以控制Apollo 2机器人上的五指、22自由度的SharpaWave手完成打结等精细动作,或将水壶放入绿色垃圾桶。它还可以操作Franka Duo平台的标准双指平行夹爪,执行复杂的灵巧任务(如紧密包装)。我们正在继续提升精度和速度,以实现接近人类水平的灵巧性。

通过智能推理和多机器人协作实现复杂任务

大多数现实任务需要在较长时间内完成多个步骤。为应对这种复杂性,我们的具身推理(ER)模型Gemini Robotics ER 2作为机器人的高级“大脑”,处理用户指令并与人类沟通。它观察环境,推理完成任务所需的步骤,与VLA协作执行操作,并跟踪进度直至任务完成。这种架构使机器人能够执行复杂的多步骤任务,在步骤失败时进行自我纠正,并推广到新的场景和目标。

此次更新中,我们使机器人能够更可靠地执行持续数分钟、涉及数百个决策的更长任务序列。Gemini Robotics ER 2现在能够识别任务的开始和结束,并能精准定位关键事件发生的时刻,标志着进度理解能力的重大飞跃。

此外,我们还引入了多机器人协作功能。这使得不同类型的机器人能够相互通信并协作,共同解决单个机器人无法独立完成的复杂工作流程。

为任何机器人快速适配本地模型

许多机器人应用需要在没有网络延迟或互联网连接的情况下运行。Gemini Robotics On-Device 2 特别针对这些限制进行设计——这是我们最高效的视觉-语言-动作模型(VLA),经过优化可在机器人设备上本地运行。

该模型原生支持多形态适配,并继承了我们从 Gemini Robotics 1.5 中的先进“运动迁移”技术。现在我们只需数小时的适配时间(通常少于200个示例),即可适配新的双臂机器人形态。即使面对形状、传感器和自由度差异巨大的新型形态,也能实现适配,如下图所示,Dexmate、SO101 和 Trossen 平台正在执行多样化的任务。

持续推进安全可靠的机器人技术

安全性是我们机器人研究的基石。随着机器人物理能力的增强,我们致力于确保端到端的安全性和对齐性。每次发布,我们都采用多层次的方法,将传统物理安全措施与强大的人工智能安全框架相结合。

Gemini Robotics 2 特别增强了机器人在应对现实世界不确定性以及与人类协作时的安全性。

我们推出了 ASIMOV-Agentic,这是一个用于代理安全协调和不确定性解决的新基准。例如,它衡量具身推理代理拒绝视觉-语言-动作模型(VLA)发起的不安全工具调用的能力。同时,它也衡量代理预测任务是否可行并在不确定时主动请求人工干预的能力。

此外,凭借增强的具身推理能力,Gemini Robotics ER 2 是我们迄今为止在安全约束遵循和人类接近度基准测试中表现最安全的机器人模型。它能更准确地检测附近的人类,触发安全工具调用,并在有人过于接近时使机器人安全停止。这是协作安全标准中的关键要求。如需了解更多详情,请阅读我们的 Gemini Robotics 2: Safety Technical Report

构建通用物理人工智能

Gemini Robotics 2 是通向物理世界通用人工智能(AGI)道路上的重要里程碑。要真正释放机器人潜力,需要超越单一任务自动化,迈向通用智能。通过构建这种核心智能,我们的目标是实现能够与人类协作解决复杂挑战的物理世界人工智能。

探索 Gemini Robotics 2

致谢

This work was developed by the Gemini Robotics team: Abhijit Ogale, Abhishek Jindal, Adil Dostmohamed, Adrian Collister, Alan Thompson, Alessio Quaglino, Alex Bewley, Alex Hofer, Alex Taeho Kim, Alex X. Lee, Alex Zihao Zhu, Allen Chai, Amaris Paryag, Amit Hampaul, Amy Nommeots-Nomm, Amy Shen, Andre Araujo, Anirudha Majumdar, Anna Volosina, Annie S. Chen, Annie Xie, Anthony Brohan, Antoine Laurens, Arunkumar Byravan, Asaf Revach, Assaf Hurwitz Michaely, Baruch Tabanpour, Ben Moran, Benoit Landry, Bingyi Cao, Bogdan Mazoure, Brandon Hernaez, Brijen Thananjeyan, Bryan Anenberg, Caden Lu, Carl Doersch, Carolina Parada, Charles Shu, Chengda Wu, Christine Chan, Christy Koh, Chuyuan Fu, Claire Cui, Clare Lee, Claudio Fantacci, Connor Schenck, David Rendleman, Deepali Jain, Demetra Brady, Dennis Li, Dhruv Shah, Dimple Vijaykumar, Dirk Ehrlich, Divya Garikapati, Dmitry Kalashnikov, Dre Mahaarachchi, Dushyant Rao, Erik Frey, Fangchen Liu, Francesco Romano, Frankie Garcia, Gabor Simko, Gautam Salhotra, Giulia Vezzani, Grace Popple, Grace Vesom, Graziano Misuraca, Guangyao Zhou, Hagen Soltau, Hanzi Mao, Hao-Tien Lewis Chiang, Harris Chan, Hila Noga, Howard Zhou, Ian Storz, Idan Lev-Yehudi, Ignacio Rocco, Inessa Konstanz, Isaac Reid, Ishita Prasad, Ivan Kapelyukh, J. Chase Kew, Jacky Liang, Jake Varley, James Susilo, Jasmine Hsu, Jerad Kirkland, Jeremy Plassmann, Jessica Lo, Jie Tan, Jimmy Yan, Jingwei Zhang, Jinyu Xie, Jose Enrique Chen, Joshua Ainslie, Joss Moore, Juanita Bawagan, Junkyung Kim, Justin Lidard, Kanishka Rao, Kathryn Quinn Shea, Kaustubh Sridhar, Keerthana Gopalakrishnan, Ken Caluwaerts, Kenneth Oslund, Khimya Khetarpal, Konstantinos Bousmalis, Krista Reymann, Krzysztof Choromanski, Ksenia Konyushkova, Kun Zhang, Kunal Aneja, Laura Graesser, Leen Verburgh, Leonard Hasenclever, Li-Heng Lin, London Chappellet-Volpini, Lucie Kerley, Maria Attarian, Maria Bauza Villalonga, Marissa Giustina, Max McCabe, Meet Kirankumar Dave, Mehdi S. M. Sajjadi, Metin Toksoz-Exley, Michael Neunert, Michael Noseworthy, Michiel Blokzijl, Miguel Rivas, Mithun George Jacob, Mitsuhiko Nakamoto, Mo Dawoud, Mohan Kumar Srirama, Mohit Sharma, Mohit Shridhar, Muinat Abdul, Murilo F. Martins, Nathan Batchelor, Nicolas Heess, Niko Milonopoulos, Norman Di Palo, Oliver Groth, Ouais Alsharif, Padmini Copparapu, Parth Parekh, Paul Ruiz, Paul Wohlhart, Peide Huang, Peng Xu, Peter Pastor, Petko Yotov, Phil Duffy, Philemon Brakel, Rachel Sterneck, Rajkumar Vasudeva Raju, Ravin Kumar, Razvan Surdulescu, René Wagner, Reza Sanatinia, Robert Baruch, Robert Moreno, Rohan Thakker, Roland Hafner, Sajjad Zafar, Sally Jesmonth, Sam Haves, Saminda Abeyruwan, Sandy Han Huang, Scott Crowell, Seliem El-Sayed, Sergey Yaroshenko, Sergio Martinez Abad, Serkan Cabi, Sharath Maddineni, Shuang Li, Sichun Xu, Silvia Cruciani, Skanda Koppula, Skye Yang, Soo Sung, Stefan Welker, Stefani Karp, Stefano Saliceti, Steven Hansen, Stuart Bowers, Sumeet Singh, Svetlana Grant, Takahiro Miki, Takuma Yoneda, Thomas Buschmann, Thomas Lampe, Thomas Power, Thor Schaeff, Tim Hertweck, Tingnan Zhang, Todd McInally, Todor Davchev, Tong Zhao, Travers Rhodes, Tsang-Wei Edward Lee, Vika Koriakin, Vikas Sindhwani, Wenhao Yu, Wentao Yuan, Xiaolin Fang, Yahav Nussbaum, Ying Sheng, Ying Xu, Yuheng Kuang, Yuxiang Yang, Yuxiang Zhou

我们想感谢 Jean-Baptiste Alayrac、Zoubin Ghahramani、Koray Kavukcuoglu 和 Demis Hassabis 的领导与支持。我们特别感谢 Google 和 Google DeepMind 各个团队为这项工作做出的贡献,包括法律、市场、传播、责任与安全委员会、负责任的开发与创新、政策、战略与运营,以及我们的商业与企业发展团队。我们还想感谢机器人团队中未明确提及的所有成员,感谢他们持续的支持与指导。最后,我们要感谢我们的合作伙伴:Apptronik、Boston Dynamics 和 Agile Robots 团队提供的支持。