REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs
TL;DR · AI 摘要
Apple提出REFACTOR-VLA系统,通过无监督学习和类型化动作程序,使VLA模型在长时任务中表现更优,实验显示增加世界模型参数反而降低性能。
核心要点
- REFACTOR-VLA使用BEK和类型化lambda项生成可重用技能
- 世界模型参数从1.88亿增至4.3亿导致4个基准套件性能下降
- 辅助InfoNCE损失使技能聚类NMI提升至0.867-0.915
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- REFACTOR-VLA
- 核心机制
- BEK聚类
- 类型化lambda项生成
- 训练阶段
- Phase A: 世界模型预热
- Phase B: 策略优化
- Phase C: 技能发现
- 实验发现
- 参数增大性能下降
- InfoNCE提升聚类质量
金句 / Highlights
值得收藏与分享的关键句。
增加世界模型参数从188M到430M导致4/4基准套件性能下降
辅助InfoNCE损失使Spatial套件NMI达0.867±0.025
BEK基于学习的潜在世界模型Mφ的动作 rollout 结果
REFACTOR-VLA:基于无监督库学习的分类型运动程序 - Apple 机器学习研究
研究领域
计算机视觉
,
方法与算法
内容类型
论文
发布日期
2026年9月
REFACTOR-VLA:分类型运动程序的无监督库学习
作者 Riyaaz Shaik, Chandru Venkataraman
查看出版物
复制Bibtex
目前大多数视觉-语言-动作(VLA)模型(如OpenVLA、π0、RT-2和RDT-1B)都是"单一整体的"架构。这意味着它们直接生成原始运动指令或非常短的动作序列,而没有将行为组织成可复用的、明确的抽象概念。因此,这些模型在长时域(多步骤)任务中表现不佳,且难以解释其学习到的内容。现有技能发现方法通常回避了判断两个动作序列是否"行为等价"的核心问题。例如,AtomicVLA和AtomSkill通过聚类对比嵌入来对动作序列进行分组。相比之下,BLADE和LRLL依赖大型语言模型(LLM)来判断序列等价性,但这些LLM并未校准到机器人的自身动态特性。我们提出REFACTOR-VLA系统,该系统采用"清醒/睡眠"架构来学习可复用技能。在睡眠阶段,系统通过行为等价核(BEK)对运动程序片段进行聚类。该BEK基于在学习到的潜在世界模型Mφ中执行动作后的结果。在清醒阶段,系统从受Hindley-Milner类型系统启发的词汇表中生成分类型的λ项(简单结构化程序)。这些λ项随后被库条件修正流动作解码器用于生成动作。只有同时满足最小描述长度(MDL)标准和回报保持门控的抽象概念才会被接受为技能。为了训练REFACTOR-VLA,我们采用三阶段计划: • 阶段A(世界模型预热):训练潜在世界模型Mφ • 阶段B(清醒阶段策略优化):优化使用技能库的策略 • 阶段C(睡眠阶段技能发现):将动作片段聚类为可复用技能 我们在完整的LIBERO基准测试套件上评估了REFACTOR-VLA。实验结果揭示了两个主要发现。首先,单纯增加世界模型规模(从1.88亿参数到4.3亿参数)导致4个基准套件中的4个性能下降,推翻了"增大世界模型规模总是有益"的假设。其次,改变训练目标显著影响效果:在世界模型预热阶段(阶段A)加入辅助监督对比损失(具体为InfoNCE损失)显著提升了睡眠阶段(阶段C)技能聚类质量。我们通过n=3多种子初始化下的归一化互信息(NMI)进行评估: • 物品套件:0.462 ± 0.021 • 空间套件:0.867 ± 0.025 • 目标套件:0.915 ± 0.013 • LIBERO-10套件:0.754 ± 0.010
相关阅读与更新
将多模态大语言模型与动作进行对齐
2025年2月20日 研究领域 计算机视觉 , 研究领域 方法与算法 会议 NeurIPS
多模态大语言模型(MLLMs)在多个领域展现了广泛的能力,包括具身AI。在本研究中,我们探讨如何通过统一架构和动作空间适配器的视角,将MLLM最佳地与不同具身形态及其对应的动作空间对齐,目标是利用MLLM的多模态世界知识。我们首先通过统一架构对多种方法进行了泛化。对于连续动作,…
阅读更多
KV-Runahead:通过并行键值缓存生成实现可扩展的因果大语言模型推理
2024年5月14日 研究领域 方法与算法 , 研究领域 语音与自然语言处理 会议 ICML
大语言模型(LLM)推理包含两个阶段:输出首个token的提示(或预填充)阶段,以及生成后续token的扩展(或解码)阶段。在本研究中,我们提出了一种高效的并行化方案KV-Runahead,用于加速提示阶段。关键观察是由于键值缓存(KV-cache)的存在,扩展阶段生成token的速度快于提示阶段。因此,KV-Runahead…
发现机器学习领域的机遇
我们的机器学习研究每天都在取得突破性进展。
与我们合作 /think