I Saw the Future of AI in a Robot That Can Learn on the Spot

TL;DR · AI 摘要
Generalist AI的机器人通过观察视频学习新任务,无需特定训练,展示了AI在物理任务中的灵活性和即兴能力。
核心要点
- 机器人通过观看视频即可完成未训练过的任务,如用香蕉当工具。
- 双臂机器人能自主切换抓取手部以适应任务需求。
- 该技术受人类物理直觉启发,可能改变AI学习范式。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Generalist AI机器人学习技术
- 核心机制
- 视频学习
- 物理知识迁移
- 典型应用
- 工具即兴使用
- 双臂协同操作
- 技术关联
- 类人物理直觉
- GPT-3启发
金句 / Highlights
值得收藏与分享的关键句。
当刷子被移除时,机器人用簸箕替代并成功完成任务。
工程师表示这种自主切换抓取手的行为此前从未出现过。
该技术与GPT-3的通用性能力存在相似性,但应用于物理世界。
我在一台能即时学习的机器人身上看到了人工智能的未来 | WIRED
Will Knight
商业
2026年8月19日 下午3:30
我在一台能即时学习的机器人身上看到了人工智能的未来
在最近参观通用人工智能公司(Generalist AI)时,我目睹了一只机械臂即兴发挥,用香蕉作为工具。
照片插图:WIRED编辑部;Getty Images
保存这个故事
上周,我冒险离开家整整15分钟,去观看机器人展示一些令人难以置信的精彩表现。
我参观了马萨诸塞州剑桥市一家名为通用人工智能公司(Generalist AI)的初创企业总部,目睹机械臂执行诸如叠放杯子、将积木放入碗中的简单家务。它们解决问题的速度之快令我震惊,简直就像一个活生生的人。
这些机械臂在观看一段简短的教学视频后,便掌握了多种任务,最令人印象深刻的是,它们并未接受特定任务的专门训练。最引人注目的例子之一是,当机器人被要求用扫帚和簸箕将积木扫入碗中时,当扫帚被移出画面,它即兴用簸箕当作扫帚,将积木弹入碗中。
通用人工智能公司提供
在另一个案例中,一只双臂机器人观看了某人拉开手提包取出钞票的视频片段。我目瞪口呆地看着机器人拉开不同种类的手提包,小心翼翼地取出钞票。最令人惊讶的是,当它无法抓取钞票时,它切换使用左手夹钳以获得更好的攻击角度。“哈,”站在旁边的工程师说道,“它以前从未这样做过。”
通用人工智能公司联合创始人兼首席执行官皮特·弗洛伦斯(Pete Florence)告诉我:“这正是人们在GPT-3发布时非常兴奋的事情。”他指的是OpenAI于2020年推出的突破性大语言模型。“你可以用这个模型,只需提示它执行新任务,它就有很大机会完成任务。”
通用人工智能公司似乎专注于教机器人理解物理世界的规律,这种思路似乎受到人类从早期就表现出的直观物理感知的启发。这可能有助于模型将在一个场景中学到的知识迁移到其他场景。事实上,该公司的一些演示让我联想到孩子们在看到任务时如何即兴发挥和实验。研究人员经常对机器人决定采取的行动感到惊讶,例如当香蕉放在它面前时,它选择用香蕉来清扫物品。这看似微不足道,但物理智能仍是机器中普遍缺乏的能力,而婴儿学习世界的方式可能为人工智能研究者提供重要启示。
我在一个俯瞰着团队成员用特制夹钳进行机器人训练的会议室里会见了弗洛伦斯和联合创始人兼首席技术官安德鲁·巴里(Andrew Barry)。公司的另一位联合创始人兼首席科学家是安迪·曾(Andy Zeng)。三人背景令人印象深刻:他们曾在美国谷歌DeepMind和波士顿动力公司工作,参与过一些最先进的硬件和机器人模型的研发。
传统上,训练人工智能机器人完成不同任务需要向模型输入数千个示例。然而,这种学习方式众所周知存在缺陷,如果改变诸如照明等简单因素,机器人就会难以应对任务。
通用机器人和一些其他机器人初创公司正在大力投资由人类训练的通用机器人模型。该公司制造了类似机器人夹钳的特殊手套,并在上面安装了摄像头,人们随后使用这些手套完成各种家务。我看到一个堆满数百个抓取器的箱子,这些抓取器将被送往墨西哥和其他地方的工人。
Florence及其团队对训练机器人的确切方法守口如瓶,但他们表示公司已经收集了大量高质量的训练数据。与一些其他公司追求更智能机器人的方式不同,他们完全从零开始构建了AI模型,而不是依赖开源语言模型。
熟悉Generalist工作的佐治亚理工学院机器人专家Danfei Xu表示,这家初创公司在追求更通用机器人模型的公司中脱颖而出。“他们将这一理念推向了极端,并且执行得非常出色,”Xu说道。除了收集大量高质量数据外,他表示:“他们本身是优秀的机器人专家,并且进行了非常出色的研究。”
Xu还表示,Generalist迄今为止展示的内容表明,他们有意将机器人部署到实际商业场景中。“他们是最接近可部署方案的公司,”他说道。
斯坦福大学机器人专家Karen Liu也了解该公司,她表示:“Generalist的数据方法是在大规模收集物理交互数据,而不过度绑定到特定机器人。”“他们最出色的结果表明,这一策略可能正在奏效。”
话虽如此,Generalist表示其模型的学习技能目前还不够可靠。平均而言,机器人只能完成它所展示任务的约59%;理想情况下,成功率应达到99%以上。此外,这些技能在各种想象中的任务或场景中的泛化能力仍不清楚。
尽管如此,机器人在制造业等场景中快速学习技能的潜力似乎巨大。最近一个晚上,Generalist的一名工程师似乎发现了这一点。一段记录该事件的视频显示,这名工程师将一些小杯子堆放在双臂机器人面前的桌子上,只是想看看机器会做什么。机器人突然加入进来,用两只抓取器抓起并堆叠其他杯子。当机器人将杯子整齐地堆成一堆时,工程师兴奋地向空无一人之处大喊。
这是Will Knight的AI Lab通讯的特辑。阅读往期通讯请访问此处。