AI breakthroughs in robotics won’t change your life any time soon

TL;DR · AI 摘要
AI机器人短期内难以改变生活,当前技术面临物理世界复杂性挑战,行业预测与专家质疑并存。
核心要点
- 特斯拉Optimus需突破物理交互复杂性,当前仅能完成简单任务
- 2050年或有10亿拟人机器人,市场规模超5万亿美元(Morgan Stanley预测)
- Yann LeCun指出:无公司能制造出足够智能的拟人机器人
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI机器人挑战
- 行业预测
- Musk预言2027年上市
- Andreessen称将成为最大产业
- 技术障碍
- 物理世界复杂性
- 语言模型局限性
- 专家质疑
- Yann LeCun否定可行性
- Nvidia称今年达人类水平存疑
金句 / Highlights
值得收藏与分享的关键句。
Yann LeCun:'None of those companies...has any idea how to make those robots smart enough to be useful'
Morgan Stanley预测2050年拟人机器人数量将达10亿,市场价值超5万亿美元
Optimus目前仅能完成分发饮料、整理垃圾等简单任务,尚未实现 Musk 宣称的'超人类灵巧度'
AI在机器人领域的突破不会很快改变你的生活 | MIT Technology Review
人工智能
AI在机器人领域的突破不会很快改变你的生活
人工智能的进步为我们展示了未来机器人像人类一样导航世界的诱人前景。问题在于,推动AI近期发展的相同技术是否足以实现这一目标,还是需要全新的路径。
Sasha Papercut
作者
- Jamie Condliffe 档案页面
2026年10月8日
本文由MIT Technology Review与Aventine合作完成,Aventine是一家非营利研究基金会,致力于创造和推广关于科技与科学如何改变我们生活方式的内容。
一个形似人类的机器人——白色身体搭配黑色头部和躯干——频繁出现在视频画面中。你可能见过它跳舞、递送爆米花、将垃圾投入垃圾桶、吸尘或按下微波炉按钮。也可能见过它在分发水瓶时后仰跌倒,或在熨烫衬衫时艰难挣扎。
这就是特斯拉的Optimus,一款由AI驱动的人形机器人。公司CEO埃隆·马斯克认为,这将是“不仅是特斯拉历史上最大的产品,可能是人类历史上最大的产品”,未来将部署在工厂车间,最终进入我们的家庭。马斯克在7月向股东表示,Optimus机器人最终将具备“超越人类的灵巧性”。他主张,每台Optimus机器人成本仅需2万美元,就能实现从搬运钢板到折叠衣物的几乎所有人类劳动自动化。他在2023年1月于瑞士达沃斯举行的世界经济论坛年会上预测,到2027年底,这类机器人就可能向公众销售。
马斯克并非唯一对此充满热情的人。硅谷风投公司Andreessen Horowitz联合创始人兼普通合伙人马克·安德森表示,机器人技术可能成为“人类历史上最大的产业”。2023年1月,英伟达CEO黄仁勋表示,今年人形机器人将具备与人类相当的能力。摩根士丹利预测,到2050年,“外形和行为都像人类”的机器人数量可能接近10亿台,创造价值超过5万亿美元的市场。
埃隆·马斯克预测,特斯拉的Optimus人形机器人可能成为全球最畅销的产品之一。目前,它最常出现在特斯拉活动上分发食物和饮料。
SIPA VIA AP IMAGES
这些宣言在很大程度上受到一种观念的推动,即OpenAI的ChatGPT和Anthropic的Claude等工具背后的人工智能进步,将使新一代机器人能够像聊天机器人模仿人类语言一样,模仿人类的运动。但许多机器人研究者持怀疑态度,认为这种假设低估了将基于语言和图像构建的智能应用于物理世界无限变化的挑战。人工智能教父之一的雅恩·乐康在达沃斯会议期间另一场活动上表示:“那些制造人形机器人的公司——绝对没有任何一家——知道如何让这些机器人聪明到足以实用。”
研究人员还指出,将拟人化机器人与所谓能够学习和执行多项任务的通用机器混为一谈的倾向是具有误导性的。"制造一个看起来像人的机器人非常容易," Agility Robotics 共同创始人兼首席机器人官 Jonathan Hurst 以及俄勒冈州立大学机器人学教授解释道,"但制造一个能像人一样动态移动或行为的机器则要困难得多。"
这些关于通用类人机器人是否即将出现还是遥不可及、当前形式的 AI 是否足以完善它们的争论,正在全国各地的机器人实验室中上演。对时间表的过度炒作正在掩盖着那些虽缓慢但意义重大的进展。
大约十年前,一系列突破引发了生成式 AI 革命,将长期设想的人工智能可能性变为现实。机器人学家们——尽管对具体时间存在分歧——认为机器人领域同样可能发生革命性变革,赋予机器以前所未及的物理直觉和流畅性。随着机器人技术的进步,问题在于:推动 AI 发展的相同方法和工具是否足以实现这一目标,还是需要全新的路径?
机器人邂逅先进 AI
要了解当今最智能的机器人"大脑"之一,可以关注 Google DeepMind 如何利用名为 ALOHA 2("A Low-cost Open-source Hardware System for Bimanual Teleoperation" 的缩写)的设备。
机器人学家们长期以来就通用机器人是否需要类人形态存在分歧,支持者认为这有助于它们融入现有世界,反对者则认为不值得费心。ALOHA 2 体现了后一种观点。它看起来并不起眼,只是一对机械臂、一些夹具和几个摄像头。但尽管看似简单,它却是 Google DeepMind 研究人员的重要工具,用于在不同实验室中测试其最先进的机器人 AI 系统 Gemini Robotics。
当由 Gemini Robotics 控制时,ALOHA 2 在某种程度上成为了一款通用机器人,能够根据训练示例执行各种任务。让它打包午餐盒时,如相关视频所示,它能用两个夹钳夹具将一片白面包小心地放入密封袋,封口后将一串葡萄放入保鲜盒,盖上盖子,再将这些物品仔细放入午餐盒中并拉上拉链。
这并不是一顿美味的午餐。但机器人能够完成这个任务,标志着相比三年前的水平取得了客观进步。
这在很大程度上归功于 AI 对所谓"机器人策略"(robot policies)的影响,这些策略决定了通用机器人如何评估和理解环境、规划移动路径并正确执行任务。
ALOHA 2 机器人本质上只是工作台上两台机械臂,但它为前沿 AI 机器人模型提供了测试平台。这些动画基于对机器人手臂的人工远程操作数据,这些数据被用于训练 Google DeepMind 的模型。(视频:Google DeepMind / 斯坦福大学 / Hoku Labs)
历史上,这些策略是基于工程师开发的规则,他们将这些规则硬编码到机器人的软件中——数千行代码决定了机器人在数百项任务中每个毫米的移动。过去几年发生的变化——也是人们对通用机器人充满乐观情绪的主要原因——是将机器人策略交由先进的AI系统处理,而非直接编码到机器人软件中。这一转变最初体现在VLMs(视觉语言模型)上。这些模型与大型语言模型类似,但它们的训练数据不仅包括文字,还包括图像。如果向VLM展示一张咖啡洒落的照片,并要求它找出清洁工具,它能够识别附近可用的布料。这种即时的环境理解能力在几年前机器人策略仍依赖硬编码时并不存在。
随后出现了视觉语言动作模型(VLAs),它们使机器人能够评估环境并在其中采取行动。这些模型通过增加另一个组件——运动指令——来实现这一功能。VLAs的训练数据包括执行特定任务的一系列图像或视频,以及与机器人手臂如何完成该任务相关的运动数据。这些运动数据通常通过远程操作(teleoperation)收集,即由人类通过遥控器引导机器人完成某个动作。这种训练方式使AI能够学习如何在特定任务中指挥机器人移动和操作。如果将搭载VLA的机器人放在桌前并告诉它“合上笔记本电脑”或“整理耳机线”,它会先观察场景,识别相关物体,规划执行请求的方案,然后挥动机械臂采取行动——当然前提是它之前曾见过类似任务的完成过程。
Gemini Robotics模型是一种VLA,它通过数小时的人类示范数据进行训练,这些数据涵盖了大量不同的动作。因此,它能够完成相对复杂的任务,比如用厨房夹子夹起豌豆、折纸或组装简单的午餐。这一表现令人印象深刻,但存在一个明显的局限性:目前,如果由VLA控制的机器人被要求执行超出其训练集的任务,很可能会失败。
“从所有任务的范围来看,真正的通用策略应该能够完成整个光谱上的所有任务,”伦敦帝国理工学院的机器人学教授爱德华·约翰斯(Edward Johns)表示。然而,目前Gemini Robotics模型只能做到“这里做几件事,那里做几件事”。
对真正通用性的探索
那么,我们该如何让机器人完成更多任务?通常的答案可能并不令人意外:通过更多数据训练它们。
更多数据意味着更多示例,而更多示例意味着更高的通用性。谷歌DeepMind希望尽可能收集“尽可能多的数据”,该公司前机器人技术负责人、现正从事AI机器人项目研究的Pannag Sanketi表示。但数据从何而来?大型语言模型得益于海量现有文本作为训练素材,而机器人训练却缺乏相应质量的物理演示数据池。研究人员虽有几种弥补方式,但都存在缺陷:一种是雇佣大量人员创建和收集远程操作数据(成本高且耗时);另一种是训练视觉语言模型(VLA)使用人类活动视频(生成的数据质量较差);还有一种是将机器人部署到现实世界中,利用实际经验数据进一步优化AI模型(但机器人在实验室外既不安全也不可靠)。Sanketi认为,采用“多管齐下”的方法,综合使用这些数据来源,可能是最可行的路径。
但认为训练数据本身就能解决问题的观点远非普遍共识。Agility的Hurst将其描述为“一个根本性错误的前提”。
问题在于现实世界中的任务会迅速变得复杂。比如,如果你试图煮咖啡,会面临无数变量:没有两间厨房是完全相同的;咖啡机的工作方式各不相同;不同杯子需要不同的握持方式;咖啡粉、热水和牛奶都需要不同的处理方式。即使这个简单的任务,也需要理解不断变化的可能性菜单。Hurst认为,通过VLA实现通用性需要“覆盖机器人可能执行的所有动作的完整数据集”,换句话说,需要一个近乎无限的训练数据池。
LeCun对这种思路不屑一顾。他在达沃斯表示:“在语言领域取得成功的AI方法,无法应对高维、连续、嘈杂的数据”——这种数据在机器人领域极为常见。“你必须采用其他方法。”
“其他方法”的首选方案是所谓的“世界模型”——一种不依赖文本,而是通过视频、三维扫描和传感器数据进行训练的AI形式,其目标是预测现实世界中行动的结果。其目标是构建能够精确反映现实内部运作机制的模型——包括物体如何移动、碰撞、下落和变形。如果机器人工程师能训练出足够贴近现实物理规律的模拟环境,开发过程将变得更加快速、廉价和安全,从而减少对现实世界测试的需求。更具变革性的是,配备世界模型的机器人将能够对周围环境进行推理,而不仅仅是被动反应,这使它们能够在采取行动前预判行为后果。
谷歌DeepMind最新推出的机器人AI模型正变得越来越灵巧,尽管目前仍显得较为缓慢且动作不连贯
Nvidia 和 Google 等公司正在研发这项技术,投资者资金正大量涌入知名初创企业。由斯坦福大学人工智能研究员李飞飞联合创立的 World Labs 于 2月获得10亿美元融资,9月底被 AMD 以82亿美元收购。由 LeCun(前 Meta 首席人工智能科学家)联合创立的 AMI Labs 也在3月获得10亿美元融资。但据他们自己承认,这项技术仍处于早期阶段。去年年底,李飞飞将该领域描述为“处于萌芽阶段”,并补充说“基础方法仍在建立中”。在6月的 Substack 文章中,她描述了令人望而生畏的挑战。目前,世界模型仍是一个有前景的研究领域,而非通往通用机器人的直接路径,但我们现在开始看到它们可能实现的曙光。
一个这样的突破出现在去年4月旧金山一家机器人实验室发生的小但可能意义重大的进展中。
突破性进展?
在旧金山 Mission District 的中心地带,初创公司 Physical Intelligence(简称 PI,取自希腊字母 π)专注于开发一种理论上的“通用大脑”,该大脑可以将任何机器人转变为通用型机器人。该公司采用“包罗万象”的方法训练机器人的人工智能模型,最近观察到配备世界模型的机器人大脑可能具备的能力。
2024 年,PI 发布了其首个通用机器人系统 π0 的细节,该公司声称这是“迄今为止最强大、最灵巧的通用机器人策略”。该模型最初是在一个包含 10,000 小时人类演示数据的专有数据集上进行训练,这些数据通过遥操作收集,同时还使用了多个开源机器人数据集。2025 年春季发布的 π0.5 版本在更多样化的数据集上进行训练,包括来自网络的标注图像,使其具备更大的灵活性。2025 年秋季更新的 π0.6 版本则加入了强化学习。
每次更新都显著提升了模型的性能,其能力范围从缓慢折叠衣物扩展到在新环境中整理物品,再到以更高成功率完成诸如折叠纸箱等任务。然后,在 2026 年 4 月,π0.7 版本似乎将 PI 带入了新的领域。这个版本使用了一个功能较弱的世界模型,该模型生成执行任务所需的步骤图像。当机器人执行任务时,这个“轻量级”模型会向其提供下一步该做什么的快照。
如何教机器人使用刀具?在初创公司 Physical Intelligence,这始于设计正确的 AI 架构,包括专门用于语言、视觉和运动的组件。这将帮助机器人将指令——“嘿,机器人,切我的蔬菜!”——与适当的动作关联起来。
WINNI WINTERMEYER
用于训练 AI 的数据可以来自许多来源,但最重要的是人类演示。该初创公司的一名员工通过遥操作控制机械臂,让 AI 接触切西葫芦的任务。
研究人员在数百个人类演示示例、网络图像和第一视角视频上训练 AI 模型。
一旦 AI 训练完成,团队就会向它展示一个它以前未见过的任务,例如切这个夏季南瓜。当机器人没有见过确切的任务时——它可能会疑惑这是否是黄西葫芦,还是某种不寻常的香蕉——它可能会出错。但任何失败都可以用来帮助完善模型。
公司声称该模型展现出组合泛化能力的初步迹象,这是指AI系统通过重组训练数据中学到的技能,来执行从未接触过的任务的能力。一项测试要求模型完成“将红薯放入空气炸锅”的任务——这是一项它从未经历过的新任务。在演示视频中,机器一开始有些笨拙,尝试了几次失败后,最终完成了还算合理的操作,尽管并未完全完成任务。
加州大学伯克利分校教授、PI联合创始人Sergey Levine对这一潜力感到兴奋:“这实际上是首次令人信服地看到这种组合泛化能力,我们基本上可以要求模型执行那些我们并未专门收集数据进行训练的任务,而它真的会做出一次合格的尝试。”
这一成功促使团队思考模型是如何实现如此成就的。经过深入研究,他们发现训练材料中隐藏着一些相关的远程操作标注数据,包括两个示例:人类操作员使用机器人将空气炸锅的篮子推入炸锅。这些零星的数据可能足以让π0.7完成将红薯几乎放入空气炸锅的操作。
目前尚不清楚π0.7的泛化能力究竟有多强大。不过,考虑到该模型接触空气炸锅的时间如此短暂,这仍然展示了当前最前沿研究能让机器人达到的水平。
“70%的成功率就像完全无法工作”
你或许会注意到实验室中机器人迈出的蹒跚第一步——“看!它把红薯放进空气炸锅了!”——与许多演示视频中机器人展现出的炫目灵活度之间存在明显差距。在这些演示中,机器人能完成从舞台跳舞到礼貌端饮料等各种任务。但这些演示往往没有明确揭示一个关键事实:在许多情况下,人类正在控制机器人或对其动作进行了精心编排。(例如,2025年3月与NVIDIA首席执行官Jensen Huang同台亮相的机器人,看似在回应他的指令并跟随其行动,实际上是由其制造商称为“幕后操控者”的人员远程控制的。)
目前,让机器人完全自主地进行运动规划——特别是在新环境(如建筑工地或陌生的住宅)中确定目标位置——仍然是一个尚未解决的难题。一个更大的挑战(尽管常常与前者相关)是让机器人处理更复杂、更模糊的任务,这些任务包含多个步骤并需要决定执行顺序。这之间的区别在于:一个机器人能将盘子放入微波炉,而另一个机器人能根据“做晚餐”的指令探索冰箱、切配食材并启动炉灶。Google DeepMind在这方面最成功的尝试——要求机器人巡视厨房并将制作蘑菇烩饭所需的所有食材装入篮子——到目前为止都以失败告终。
更复杂的是,实用的机器人必须几乎每次都能正确执行任务。波士顿动力公司创始人Marc Raibert表示:“当VLAs的成果从50%的成功率提升到70%时,人们会非常兴奋。但70%的成功率就像完全无法工作,对吧?”
演示常常让人觉得机器人很有用,但这些机器在家庭和工厂中仍频繁出错,无法可靠使用。
AP IMAGES, SHUTTERSTOCK, 1X, AGILITY ROBOTICS, GOOGLE DEEPMIND
目前在现实环境中测试的少数人形机器人仅在高度受控的环境中执行极其有限的任务。它们还远未达到通用水平。据公司称,Agility 已在全球多个由 GXO Logistics、Amazon 和 Schaeffler 拥有的设施中部署了数百台机器人。但目前,Hurst 表示,这些机器人主要针对简单任务,例如搬运箱子和托盘。他补充说,即使如此,开发出足够安全的机器人以供物流公司在实际中考虑使用,也花了数年时间。就马斯克而言,他在 2025 年 5 月声称,“数千”台 Optimus 机器人将在年底之前在特斯拉工厂工作,但今年 1 月他表示,公司目前仅有“部分 Tesla Optimus 机器人在工厂执行简单任务”。
尽管人形机器人开始进入工厂,但要进入家庭环境将更加困难。目前,如果您有此意愿,可以预订 1X Neo 家用机器人,预计今年晚些时候将开始交付。这款售价 2 万美元的机器人承诺将“处理家中那些无聊而琐碎的任务”——收拾餐具、应答门铃、整理客厅——“以便您专注于对自己重要的事情”。这款身高五英尺六英寸的机器人未来有一天将能够自主完成所有这些任务,但目前大多数任务仍需要远程人工操作员协助。(是的,有人需要获得许可才能通过机器人的摄像头查看您的家。)当被问及完全自主的机器人何时能胜任家庭工作时,Hurst 表示:“如果非要选一个数字,我认为要 10 年后,机器人才能……真正在家用场景中发挥实际作用。”
当这一天到来时,这些机器人很可能是中国制造的,因为中国在生产方面远超西方。根据市场情报公司 Omdia 和中国机器人企业 Unitree 的数据,2025 年交付的约 15,000 台人形机器人中,近 90% 来自中国企业。Unitree 今年生产的人形机器人数量超过任何其他公司,其一款型号的售价低于 6,000 美元。如此低廉的价格可能大幅提高机器人对消费者的吸引力,尽管该公司预计其设备将首先用于工业应用。(顺便说一句,如果您想知道谁在购买所有这些中国机器人,AP 最近报道指出,订单主要来自企业、学术实验室和国有企业。)
我们并非首次经历这一切
制造人形机器人的梦想由来已久:早在 1495 年,达芬奇就绘制了由绳索和滑轮控制的机械骑士设计图。20 世纪以来,科幻小说中狂热想象的机器人们不断涌现又消失。
1939 年世界博览会上,Westinghouse 的 Elektro 引起轰动。
GETTY IMAGES
Westinghouse 于 1939 年在纽约世博会上展示了其七英尺高的带腿机器人 Elektro,它甚至会抽烟。1973 年,日本早稻田大学研发的 WABOT-1 是首个全尺寸可编程人形机器人。本田 2000 年推出的 ASIMO 可能是首个真正具备实用能力的机器人——它至少能在一定程度上爬楼梯、识别人脸并自主穿越空间。但这款机器人于 2018 年停产,因为其实际能力未能超越演示效果,无法投入实用。
当时这些成就都堪称工程领域的惊人壮举。但它们都无法应对真实世界。如今的机器人即使拥有先进 AI 的变革力量,仍面临同样的生存挑战。
深度解析
人工智能
别被误导——大语言模型并不具备推理能力
AlphaGo 与围棋冠军李世石对弈十年后,如今的 AI 仍未掌握当年取胜所依赖的核心机制。
- Thore Graepel 档案页面
AI 的递归自我改进可能不会来得那么快
看来 AI 代理尚未具备足够的创造力,无法开展真正创新的开放性 AI 研究。
- Michelle Kim 档案页面
别被今年夏天的 AI 热潮误导
关于通用人工智能(AGI)和新功能的激动人心的宣称,在仔细审视下很快就会土崩瓦解。
- Timnit Gebru 档案页面
- Emily M. Bender 档案页面
这些初创公司正在追逐大语言模型的下一个风口
认识一下正在追赶 AI 巨头的新晋玩家。
- Will Douglas Heaven 档案页面
保持联系
插画:Rose Wong
获取 MIT Technology Review 最新动态
发现特别优惠、热门故事、即将举行的活动等更多信息。