Apple Machine Learning Research

REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs

8.5内容质量

TL;DR · AI 摘要

Apple提出REFACTOR-VLA系统,通过无监督学习和类型化动作程序,使VLA模型在长时任务中表现更优,实验显示增加世界模型参数反而降低性能。

核心要点

  • REFACTOR-VLA使用BEK和类型化lambda项生成可重用技能
  • 世界模型参数从1.88亿增至4.3亿导致4个基准套件性能下降
  • 辅助InfoNCE损失使技能聚类NMI提升至0.867-0.915

结构提纲

按章节快速跳转。

  1. 指出当前VLA模型在长时任务和可解释性方面的不足。

  2. REFACTOR-VLA采用wake/sleep架构,结合BEK和类型化lambda项生成技能。

  3. 分三阶段训练:世界模型预热、策略优化、技能发现。

  4. 增加世界模型参数导致性能下降,辅助损失显著提升聚类质量。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • REFACTOR-VLA
    • 核心机制
      • BEK聚类
      • 类型化lambda项生成
    • 训练阶段
      • Phase A: 世界模型预热
      • Phase B: 策略优化
      • Phase C: 技能发现
    • 实验发现
      • 参数增大性能下降
      • InfoNCE提升聚类质量

金句 / Highlights

值得收藏与分享的关键句。

#Computer Vision#Robotics#Methods and Algorithms#AI
打开原文

REFACTOR-VLA:基于无监督库学习的分类型运动程序 - Apple 机器学习研究

研究领域

计算机视觉

,

方法与算法

内容类型

论文

发布日期

2026年9月

REFACTOR-VLA:分类型运动程序的无监督库学习

作者 Riyaaz Shaik, Chandru Venkataraman

查看出版物

复制Bibtex

目前大多数视觉-语言-动作(VLA)模型(如OpenVLA、π0、RT-2和RDT-1B)都是"单一整体的"架构。这意味着它们直接生成原始运动指令或非常短的动作序列,而没有将行为组织成可复用的、明确的抽象概念。因此,这些模型在长时域(多步骤)任务中表现不佳,且难以解释其学习到的内容。现有技能发现方法通常回避了判断两个动作序列是否"行为等价"的核心问题。例如,AtomicVLA和AtomSkill通过聚类对比嵌入来对动作序列进行分组。相比之下,BLADE和LRLL依赖大型语言模型(LLM)来判断序列等价性,但这些LLM并未校准到机器人的自身动态特性。我们提出REFACTOR-VLA系统,该系统采用"清醒/睡眠"架构来学习可复用技能。在睡眠阶段,系统通过行为等价核(BEK)对运动程序片段进行聚类。该BEK基于在学习到的潜在世界模型Mφ中执行动作后的结果。在清醒阶段,系统从受Hindley-Milner类型系统启发的词汇表中生成分类型的λ项(简单结构化程序)。这些λ项随后被库条件修正流动作解码器用于生成动作。只有同时满足最小描述长度(MDL)标准和回报保持门控的抽象概念才会被接受为技能。为了训练REFACTOR-VLA,我们采用三阶段计划: • 阶段A(世界模型预热):训练潜在世界模型Mφ • 阶段B(清醒阶段策略优化):优化使用技能库的策略 • 阶段C(睡眠阶段技能发现):将动作片段聚类为可复用技能 我们在完整的LIBERO基准测试套件上评估了REFACTOR-VLA。实验结果揭示了两个主要发现。首先,单纯增加世界模型规模(从1.88亿参数到4.3亿参数)导致4个基准套件中的4个性能下降,推翻了"增大世界模型规模总是有益"的假设。其次,改变训练目标显著影响效果:在世界模型预热阶段(阶段A)加入辅助监督对比损失(具体为InfoNCE损失)显著提升了睡眠阶段(阶段C)技能聚类质量。我们通过n=3多种子初始化下的归一化互信息(NMI)进行评估: • 物品套件:0.462 ± 0.021 • 空间套件:0.867 ± 0.025 • 目标套件:0.915 ± 0.013 • LIBERO-10套件:0.754 ± 0.010

相关阅读与更新

将多模态大语言模型与动作进行对齐

2025年2月20日 研究领域 计算机视觉 , 研究领域 方法与算法 会议 NeurIPS

多模态大语言模型(MLLMs)在多个领域展现了广泛的能力,包括具身AI。在本研究中,我们探讨如何通过统一架构和动作空间适配器的视角,将MLLM最佳地与不同具身形态及其对应的动作空间对齐,目标是利用MLLM的多模态世界知识。我们首先通过统一架构对多种方法进行了泛化。对于连续动作,…

阅读更多

KV-Runahead:通过并行键值缓存生成实现可扩展的因果大语言模型推理

2024年5月14日 研究领域 方法与算法 , 研究领域 语音与自然语言处理 会议 ICML

大语言模型(LLM)推理包含两个阶段:输出首个token的提示(或预填充)阶段,以及生成后续token的扩展(或解码)阶段。在本研究中,我们提出了一种高效的并行化方案KV-Runahead,用于加速提示阶段。关键观察是由于键值缓存(KV-cache)的存在,扩展阶段生成token的速度快于提示阶段。因此,KV-Runahead…

发现机器学习领域的机遇

我们的机器学习研究每天都在取得突破性进展。

与我们合作 /think