We scaled a robot model natively to 8,000 timesteps of context, 5 minutes worth of muscle memory, wi...
TL;DR · AI 摘要
Jim Fan on X: "We scaled a robot model natively to 8,000 timesteps of context, 5 minutes worth of muscle memory, with co...
核心要点
- 主题聚焦:We scaled a robot model natively to 8,000 timest
- 来源:Jim Fan(@DrJimFan),建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
Jim Fan 在 X 上的推文:"我们原生扩展了机器人模型,使其能够处理 8000 个时间步的上下文,相当于 5 分钟的肌肉记忆,且推理成本保持恒定。过去机器人策略通常只能处理几帧(<0.1 秒)的实时数据,瞬间遗忘刚刚发生的事情。我们实现了比 SOTA 提升 3 个数量级的突破。介绍 RoboTTT。测试时训练("TTT")在模型内部嵌入了一个微型模型。每个传感器输入都会触发一次对微型核心的梯度更新,从而将历史信息持续压缩到权重中。隐藏状态的大小固定(字面意义上是一个小型神经网络),因此机器人可以以极低的开销“理解”任意长度的经验。部署后学习可以无限持续。我们随后可以将整个视频作为上下文提示!RoboTTT 实现了从人类视频中进行单次示例的上下文学习:在电路板组装中,人类演示一次从未见过的配置,机器人就能忠实地模仿。人类经常掉落物品,但我们捡起它们的速度如此之快,以至于几乎不会察觉。这种修复反射构成了我们身体能力的一半。RoboTTT 展示了实时自我改进的能力:机器人在单次演示中能熟练地从自身错误中恢复,每次修复都会进入上下文以指导下一步行动。TTT 核心从训练数据中提炼出通用的“失败到修正”映射关系。还有一个令人兴奋的点:我最激动的是新的上下文扩展曲线:从 128 到 8000 个时间步,闭环性能稳步提升,没有出现饱和迹象。8000 上下文预训练比 1000 上下文提升 62%。LLM 喜欢的,机器人也应该喜欢。很快,即使 100 万上下文也不会是幻想。深入分析请看推文:"
Jim Fan
@DrJimFan
我们原生扩展了机器人模型,使其能够处理 8000 个时间步的上下文,相当于 5 分钟的肌肉记忆,且推理成本保持恒定。过去机器人策略通常只能处理几帧(<0.1 秒)的实时数据,瞬间遗忘刚刚发生的事情。我们实现了比 SOTA 提升 3 个数量级的突破。介绍 RoboTTT。测试时训练("TTT")在模型内部嵌入了一个微型模型。每个传感器输入都会触发一次对微型核心的梯度更新,从而将历史信息持续压缩到权重中。隐藏状态的大小固定(字面意义上是一个小型神经网络),因此机器人可以以极低的开销“理解”任意长度的经验。部署后学习可以无限持续。我们随后可以将整个视频作为上下文提示!RoboTTT 实现了从人类视频中进行单次示例的上下文学习:在电路板组装中,人类演示一次从未见过的配置,机器人就能忠实地模仿。人类经常掉落物品,但我们捡起它们的速度如此之快,以至于几乎不会察觉。这种修复反射构成了我们身体能力的一半。RoboTTT 展示了实时自我改进的能力:机器人在单次演示中能熟练地从自身错误中恢复,每次修复都会进入上下文以指导下一步行动。TTT 核心从训练数据中提炼出通用的“失败到修正”映射关系。还有一个令人兴奋的点:我最激动的是新的上下文扩展曲线:从 128 到 8000 个时间步,闭环性能稳步提升,没有出现饱和迹象。8000 上下文预训练比 1000 上下文提升 62%。LLM 喜欢的,机器人也应该喜欢。很快,即使 100 万上下文也不会是幻想。深入分析请看推文:
下午3:25 · 2026年7月15日
184.5K
浏览量
5
3
53
1
9
159
.
K
1.1K
6
8
658
阅读 53 条回复