Wired AI

AI Isn’t Smarter Than a Baby—Yet

8.5内容质量
AI Isn’t Smarter Than a Baby—Yet

TL;DR · AI 摘要

AI在学习效率上仍不如婴儿,婴儿大脑的机制可能为AI提供新方向。Meta等机构通过EgoBabyVLM挑战赛揭示当前AI模型处理婴儿视角数据时的局限性。

核心要点

  • EgoBabyVLM挑战赛要求AI模型处理1000小时婴儿视角视频数据,但当前模型表现不佳。
  • 婴儿通过少量数据学习,而AI模型需要消耗相当于小国家能源的训练数据。
  • 婴儿学习依赖多模态体验,而不仅是语言,这对AI设计有启发。

结构提纲

按章节快速跳转。

  1. 通过对比1岁婴儿与AI模型的学习效率,揭示AI的局限性。

  2. 婴儿通过少量数据和多模态体验高效学习,与AI的训练方式形成对比。

  3. EgoBabyVLM挑战赛

    Meta等机构设计的测试要求AI模型处理婴儿视角的视频数据,暴露其局限性。

  4. 借鉴婴儿学习机制可能降低AI能耗并提升自然环境学习能力。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI与婴儿学习机制对比
    • EgoBabyVLM挑战赛
      • 婴儿视角视频数据测试
    • 婴儿学习优势
      • 多模态体验
      • 低能耗学习
    • AI改进方向
      • 模仿婴儿学习机制
      • 降低能耗

金句 / Highlights

值得收藏与分享的关键句。

#AI#认知科学#机器学习#婴儿学习机制
打开原文

AI尚未比婴儿更聪明 | WIRED

Will Knight

商业

2026年7月15日 下午2:30

AI尚未比婴儿更聪明

婴儿是强大的学习机器,AI的关键突破可能很快会从他们小小大脑的结构中找到答案。

照片插图:WIRED编辑部;Getty Images

保存此故事

如果你认为运行在数千块尖端芯片上的人工智能模型很聪明,那让我向你介绍一岁婴儿的概念吧。

好吧,婴儿可能无法编写计算机程序、解决高阶数学问题或辩论哲学思想。但与当今消耗相当于整个海洋的训练数据、耗能堪比小国的AI模型不同,婴儿能以惊人的效率理解世界。他们只需看一两次就能识别新物体,通过短暂观察和身体互动进行学习。

在改进AI方面,婴儿及其大脑结构可能蕴含关键洞见。构建更接近婴儿的AI版本,可能使前沿模型成本更低、能耗更少,同时如果AI机器人要以更自然的方式学习环境,这种设计也可能具有重要价值。

为探索这一大胆的新领域,Meta、斯坦福大学、东京大学以及法国高等师范学院的研究人员开发了一项新测试,突显婴儿的学习能力,并推动AI研究者设计能与之匹配的算法。

EgoBabyVLM挑战赛评估视觉语言模型(VLM)理解世界的能力,这些模型通过文本和图像学习。测试要求模型在摄入约1000小时的视频后描述世界,这些视频来自绑在婴儿和幼儿头上的摄像头。(是的,真的如此。)

事实证明,当这些尖端模型被输入这种真实且混乱的视频时表现糟糕,这表明婴儿大脑的设计可能存在特殊之处,使它们能从极少的信息中快速学习。

与精心策划的数据集不同,婴儿接触的是五彩缤纷的场景:父母谈论看不见的物体,通过目光或手势指示事物,讨论过去或未来的事件,而非当下正在发生的事。斯坦福大学认知科学家迈克尔·弗兰克(Michael Frank)表示,婴儿的学习不仅来自语言,还来自丰富的多模态和触觉体验,他专攻语言学习并参与了EgoBabyVLM的开发。

该测试表明,对于AI来说,“显然需要更多(不仅仅是语言)的东西”,弗兰克说道。

语言学习

EgoBabyVLM只是科学家使用AI探索人类智能的最新案例。2023年推出的BabyLM挑战赛要求AI模型使用与10岁儿童相当的数据量(数千万词,而非AI模型常用的万亿词)学习语言语法。令人惊讶的是,基于Transformer的AI模型——通过关注不同句子中词语之间的关系来处理语言——能很好地完成这项任务,这一发现挑战了诺姆·乔姆斯基关于语法可能硬编码在人类大脑中的观点。

ETH Zurich 的语言学家 Ryan Cotterell 表示,当涉及到对物理世界的理解时,情况有所不同。他说:“不会存在大量的人类互动语料库——没有人类互动的互联网。”

麻省理工学院的认知科学家 Joshua Tenenbaum 指出,BabyLM 展示了模型并未获得关于物理世界、社会动态或心智理论的“常识”。Tenenbaum 表示:“Transformer 在数据中发现模式方面非常出色。但看起来仅靠纯粹的模式学习系统,无法像婴儿或儿童那样从接收到的数据中学习所有他们能做到的事情。”

一个持续存在的问题是:进化是否在人类和其他动物身上优化了某些学习技能,还是简单的学习算法能够完成我们做的一切?Tenenbaum 表示:“认知科学和神经科学界对大脑中进化形成的结构有多少存在很大争议。大脑极其复杂,内部有大量固有的结构和架构。”

2024 年,研究人员展示了一种基础的 VLM 仅通过消耗单个婴儿头部记录的数据,就能学习简单的事物,比如“球是什么”。但这种模型距离以复杂方式推理世界还有很大差距。普林斯顿大学参与该项目的认知科学家 Brendan Lake 表示:“令人着迷的是,儿童在 2 岁时就能达到他们拥有的全部能力,这是个谜。”

《EgoBabyVLM》论文的作者建议,借鉴认知科学和神经科学中的不同理念,可能有助于开发更接近人类的学习算法。这包括设计能够长时间保持注意力并能解读社会线索的模型。

斯坦福大学的 Frank 已经展示了新颖的方法可以让我们更接近婴儿般的 AI。今年早些时候,他与同事测试了一种新型模型,该模型擅长学习因果关系及视觉和时间关系(即物体如何随时间相互影响),使用的是相同婴儿头部视频数据。他们发现,这种新模型能更有效地学习不同物体的动态特性,这是物理推理的基础。

这是一个诱人的可能性:或许对物理和社会关系等事物具有快速学习偏见的模型,整体上可能成为更高效的学习者。

Lake 表示:“EgoBabyVLM 是一个绝佳的挑战。我期待看到研究人员会提出哪些新的架构、方法和要素。”

这是 Will Knight 的 AI Lab 通讯的一期。阅读之前的通讯请访问此处。