刚刚,全球首个“事件级预测”具身智能世界模型来了!
自变量机器人发布全球首个事件级预测具身智能世界模型WALL-WM,将预测单位从时间帧升级为语义事件(如“抓取”“放置”),显著提升跨场景泛化能力与动作鲁棒性。
入选理由:WALL-WM以语义事件(如抓取、抬升)为建模单元,替代传统固定时长动作块,使动作长度可变且更符合物理逻辑
概念
别名:视觉语言模型
一种结合视觉和语言的模型,但存在真实任务中的局限性。
已跟踪 10 条高相关材料
最近变化
2026-06-18 · 因果世界模型需要在隐空间中同时学习感知、行动和因果。
为什么值得关注
VLA 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
刚刚,全球⾸个“事件级预测”具身智能世界模型来了!
量子位 · 9.2 分
自变量机器人发布全球首个事件级预测具身智能世界模型WALL-WM,将预测单位从时间帧升级为语义事件(如“抓取”“放置”),显著提升跨场景泛化能力与动作鲁棒性;其核心采用三层架构(事件指令→事件世界模型→多视角融合)、共享权重双推理模式、视频/动作模型解耦训练,并引入阶梯式思维链...
“VLA和世界模型都不是终局,会有物理世界独有的模型” | 蚂蚁灵波沈宇军@AIGC2026
量子位 · 8.7 分
沈宇军认为VLA和世界模型并非具身智能终局,未来将出现专属于物理世界的模型。机器人数据稀缺,需从传感器输入端构建空间感知能力。
哪条路线,才能通往「世界模型」的终局?|对话黄碧薇:Aether AI 创始人
十字路口Crossing · 8.5 分
世界模型的终局需要因果推理,Aether AI 通过因果世界模型探索新路径。
已收录 10 条与 VLA 相关的内容,按评分排序。
自变量机器人发布全球首个事件级预测具身智能世界模型WALL-WM,将预测单位从时间帧升级为语义事件(如“抓取”“放置”),显著提升跨场景泛化能力与动作鲁棒性。
入选理由:WALL-WM以语义事件(如抓取、抬升)为建模单元,替代传统固定时长动作块,使动作长度可变且更符合物理逻辑
沈宇军认为VLA和世界模型并非具身智能终局,未来将出现专属于物理世界的模型。机器人数据稀缺,需从传感器输入端构建空间感知能力。
入选理由:机器人行业缺乏物理世界数据,需构建专属物理模型
世界模型的终局需要因果推理,Aether AI 通过因果世界模型探索新路径。
入选理由:因果世界模型需要在隐空间中同时学习感知、行动和因果。
2026年AI行业进入估值跳涨与价值重估并存的拐点,创业者需关注垂类应用、具身智能及AI硬件等方向。
入选理由:2026年AI行业估值跳涨与价值重估并存,创业者需谨慎选择赛道。
小鹏汽车在CVPR 2026发布物理AI基座模型,通过融合第二代VLA与世界模型实现密集物理预测与稀疏人类意图的协同进化。该架构依托X-World等三大核心技术及全栈自研芯片,将车端推理时延降至80ms,验证了自动驾驶Scaling Law在量产车上的有效性。
入选理由:小鹏第二代VLA与世界模型协同进化,单版训练Token破4万亿,解决稀疏意图监督难题。
全球首个在百TOPS端侧芯片实现实时世界模型的隐式方案 Being-H-Flash 问世:单台机器人月算力成本仅150元,较英伟达 Cosmos 低2%,较 Pi0.5 便宜70%,支持国产与英伟达双平台,显著降低部署与网络延迟风险,推动世界模型走向规模化落地。
入选理由:单台机器人月算力成本降至150元,实现端侧实时世界模型推理。
英伟达 GEAR 实验室推出 DreamDojo 和 DreamZero 世界模型,推动具身智能发展。
入选理由:英伟达 GEAR 实验室发布 DreamDojo 世界模型,支持视频数据训练。
英伟达Jim Fan宣布VLA路线过时,提出新范式WAM,代表作为DreamZero,预计2040年实现机器人自主设计制造,置信度95%。
入选理由:VLA路线过时,新范式WAM登场
NVIDIA科学家Jim Fan在Sequoia AI Ascent会议上提出,机器人技术仅剩3项关键突破,95%确信2040年前将实现通用具身智能的全面工程化落地。
入选理由:机器人技术瓶颈已收敛至感知-推理-执行闭环中的三个具体缺口:长程任务规划、零样本技能迁移、物理世界鲁棒交互。
CHORUS 是一种基于单一 VLA 策略的去中心化多实体协作方法,但文章内容信息密度低,缺乏具体机制和实践细节。
入选理由:CHORUS 采用单一 VLA 策略实现多实体协作。