Wayve, Decart, NEURA Robotics, Nissan: All Running Physical AI on CoreWeave

TL;DR · AI 摘要
CoreWeave为物理AI提供定制化基础设施,支持Wayve、Decart等公司实现高效训练和实时推理。
核心要点
- 物理AI需要生成模拟训练数据,真实场景数据不足时需依赖仿真
- 多模态传感器融合要求内存带宽比单模态任务高3-5倍
- 毫秒级推理延迟是物理AI系统部署的硬性指标
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 物理AI基础设施
- 核心需求
- 模拟数据生成
- 多模态处理
- 实时推理
- 解决方案
- CoreWeave栈
- 行业应用案例
金句 / Highlights
值得收藏与分享的关键句。
物理AI需要生成模拟训练数据,因为真实场景数据不足时需依赖仿真
多模态传感器融合需要比单模态工作负载高3-5倍的内存带宽
毫秒级推理延迟是物理AI系统部署的硬性指标,两秒响应对机器人不可接受
CoreWeave 的物理 AI 技术栈 | CoreWeave 博客
发布于
2026 年 8 月 24 日
分钟阅读
Wayve、Decart、NEURA Robotics、Nissan:均基于 CoreWeave 运行物理 AI
作者
Justin Hodges
Sasha Manuilova
已复制
机器人在接触真实织物之前,通过数千次模拟尝试进行训练,从而学会如何折叠衣物。自动驾驶汽车在真正上路之前,通过数百万英里的模拟训练学习如何应对行人突然横穿马路。无人机机翼在制造原型之前,会在模拟环境中进行一万次测试。全球汽车制造商将历史测试数据转化为更高效的车辆开发周期。Wayve、Decart、NEURA Robotics、nTop 和 Nissan 等公司并不属于同一行业,也不处于物理 AI 开发流程的相同阶段:有些团队从仿真到部署完整运行整个流程,有些团队则只依赖其中某个环节。它们的共同点在于底层技术栈。这些工作均不依赖事后的通用云平台拼接而成。
本文将解析这一技术栈:计算能力、编排系统、工具链和工程能力,以及团队如何根据工作负载在流程中的位置选择使用不同的技术组件。
物理 AI 的独特之处
物理 AI 消除感知与行动之间的鸿沟:传感器采集现实世界输入,视觉和 3D 模型进行解读,其他模型决定执行方案,执行器实时完成物理动作。这种动态引入了传统 AI 从未面对的约束:毫秒级延迟要求、安全关键型可靠性标准、需要处理三维空间和视觉输入而非平面文本的模型,以及通常需要通过物理仿真生成而非从互联网抓取的训练数据。
大型语言模型基于互联网上已有的文本数据进行训练。目前尚不存在机器人学习折叠衣物或车辆学习应对行人横穿马路的视频数据集,因此物理 AI 团队必须自行生成这些训练数据,通过仿真或对有限的真实世界数据进行合成修改,而非完全依赖真实世界数据的采集。
物理 AI 基础设施的职责
这些现实约束转化为物理 AI 实际需要的基础设施的五个要求:
- 模拟生成的训练数据。计算负担甚至在训练开始前就已产生:基础设施需要处理海量真实视频数据,进行筛选、生成合成版本,并渲染和模拟模型学习的环境与物体交互。
- 多模态传感器融合。视觉、深度、力和本体感觉数据同时到达,需要协同处理,这对内存带宽的需求远超单模态工作负载。
- 毫秒级推理。聊天机器人两秒的响应时间可以接受,但对机械臂或车辆避障系统来说则完全不可接受。
- 持续再训练循环。系统部署后,边缘案例会迅速积累,因此检查点机制和快速数据管道成为运营必需,而非可选功能。
- 具有实际后果的容错性。软件中的模型故障只会产生不良输出,而在物理系统中,可能会产生危险的后果。因此,对于物理AI来说,大部分工作必须在仿真和分阶段验证中运行,直到模型获得在现实世界中运行的资格,而非像大多数软件AI那样直接进入实时生产环境。
如需深入了解该领域的分类,可参见CoreWeave的说明:什么是物理AI?
物理AI循环:观察、整理、改进、评估、运行
满足这些要求需要一个飞轮效应:同时观察真实传感器数据和仿真环境,整理并生成其合成版本,通过各种形式的训练改进模型,在部署到现实世界运行前,先通过评估调用这些模型进行预测。凭借CoreWeave的规模和性能,这个飞轮将持续运转直至达到精度要求,而不会受到基础设施限制。
这个飞轮并非理论概念。CoreWeave已在物理AI工作负载中构建并部署了参考流水线,使团队能够看到相同的生成、训练、评估、重复流程在真实问题上运行,而非从空白集群开始。以下示例并非针对最大吞吐量优化,而是简单的演示以展示可实现的成果:
#### MuJoCo中的机器人操作
一个模拟的机械臂在家庭厨房环境中执行多项抓取与放置任务。我们使用MuJoCo在单个节点上85分钟内运行了4800次模拟,为每个任务执行了模拟、渲染和数据生成。
#### NVIDIA Isaac Sim中的机器人合成数据生成
我们使用Isaac Sim作为合成数据工厂,仅用21分钟就生成了10000个随机化仓库场景样本。每个样本由三个虚拟摄像头观测并保存带有标签的数据,这些标签可供感知模型学习。这是一次大规模并行生成带标签的视觉训练数据的运行。
#### NVIDIA Isaac Sim中的机器人仿真
通过NVIDIA Isaac Sim的Franka抓取与放置示例,我们仅用不到8小时就运行了113000次模拟。每个场景中,模拟机械臂移动、夹取立方体、转移立方体,并测量放置是否成功。
#### CARLA中的自动驾驶仿真
在CARLA中,约12小时内运行了125万次自动驾驶仿真。这些仿真在独立的一GPU分片中变化了天气、交通密度、地图、交叉口和种子参数。
#### NVIDIA AlpaSim中的自动驾驶仿真策略评估
AlpaSim渲染摄像头观测,模型规划轨迹并反馈到世界环境,形成一个会暴露累积误差的闭环。我们在不到四小时内运行了超过1600次模拟推演。这加速了模型在多种关键场景下的对比,可在道路测试前快速定位故障,但本身并非安全认证。
#### NVIDIA Isaac Lab中的强化学习
该项目使用NVIDIA Isaac Lab和RL-Games PPO学习方法,训练AI控制器通过模拟的Shadow Hand重新定位立方体。每个GPU同时并行运行8192个独立的手部与立方体物理模拟。这些模拟是针对同一任务的不同尝试,而非8192个不同的AI模型,使控制器能够同时从大量经验中学习。
这些蓝图今天已在CoreWeave上开放。评估该技术栈的团队无需盲目信任这一流程,他们可以直接运行并观察其在自身数据上的表现。
============================================================ 视频网格 — Webflow CMS博客内容代码嵌入 ============================================================ 使用方法:1. 填写下方VIDEOS数组中的6个项目(缩略图图片URL、视频URL以及每个项目的标题/说明)。2. 将整个代码块粘贴到博客文章的富文本/内容区域内的Webflow“嵌入”(代码)元素中。3. 缩略图应为Webflow托管资源(通过资源面板上传)或任意公开图片URL。视频可以是直接的.mp4 URL、YouTube链接或Vimeo链接——脚本会自动识别类型。 =============================================================
×
物理AI已部署的应用场景
CoreWeave目前看到的大部分需求集中在三个类别,每个类别对基础设施都有不同的压力:
机器人领域。人形机器人、工业机器人和自主机器依赖于长期运行的GPU任务进行策略训练、模型微调、合成数据生成和仿真到现实验证——瓶颈通常是迭代速度,而非原始模型规模。
自动驾驶。自动驾驶汽车、卡车、无人机和班车需要世界模型训练、视觉语言动作(VLA)模型微调、传感器仿真和闭环评估,每天每辆车会产生数TB的传感器数据,这些数据必须高效传输、存储和训练。
工业领域。高保真物理仿真和数字孪生正在从传统CPU集群迁移到GPU,云采用率强劲,使工程团队能够在零件或系统实际构建或测试前预测其性能。
CoreWeave物理AI技术栈
CoreWeave对物理AI团队的承诺是:他们不应在开始构建VLA(视觉语言动作)、世界模型和强化学习策略前,花费数月时间拼接仿真、训练、存储和实验追踪。该平台旨在端到端覆盖物理AI全流程,因此现场出现故障的检查点可以直接追溯到产生它的具体运行和数据集,无需切换工具进行排查。
CoreWeave物理AI技术栈
基础设施层
所有服务均基于裸金属NVIDIA GPU集群(RTX、Blackwell、Hopper和Ada Lovelace架构),提供96%的有效计算能力,相比通用云服务,三年总拥有成本降低高达47%,由Signal65独立验证。NVIDIA RTX PRO 6000 Blackwell GPU负责处理高保真合成环境和数字孪生背后的光线追踪渲染和神经图形,这些GPU运行在与训练模型相同的平台上。CPU计算则负责传感器和仿真数据预处理这些不那么光鲜但至关重要的工作。
如果没有底层架构的支持,这些优势将无从谈起。CoreWeave的AI基础设施采用高速互连技术,通过InfiniBand和RoCE(RDMA over Converged Ethernet)实现跨服务器GPU之间的直接数据传输,绕过CPU和传统网络的开销。这至关重要,因为物理AI训练任务通常需要数百个GPU持续交换传感器数据、模拟状态和梯度。缺乏这种互连技术时,GPU会在批次间空转等待数据到达,而非进行计算。分布式存储和对象存储可直接处理PB级的传感器和模拟数据,无需额外构建独立的数据管道。CoreWeave Kubernetes Service(CKS)则负责协调运行在这些基础设施上的训练和模拟任务。
这种编排方式不会限制团队的选择。CKS采用标准Kubernetes架构,因此工作负载通过开放的清单文件定义,而非专有调度器。如果物理AI团队需要投入数年时间进行基础设施决策,可移植性与性能同样重要。
CoreWeave是首家部署完全验证的NVIDIA Vera Rubin NVL72系统的AI云服务商,同时是首家被NVIDIA授予“Exemplar Cloud”认证(用于训练和推理)的云服务商,并在MLPerf v6.0基准测试中取得领先成绩。这意味着与CoreWeave合作时,您将获得最早接触最新GPU架构的机会。
长期任务的调度与编排
物理AI工作负载与典型的推理流量截然不同:强化学习训练、仿真到现实验证以及世界模型任务具有长期性和突发性特征。SUNK(Slurm on Kubernetes)可跨GPU集群调度这些任务,而CoreWeave Sandboxes则为智能体和实验性工作流提供安全的隔离式代码执行环境。
成本可视性与调度粒度保持一致。SUNK和CKS通过Grafana将GPU利用率细化到任务和命名空间层级,使平台团队能够追溯到具体训练任务、团队或工作负载所产生的支出。结合CoreWeave的零出站流量计费模式,平台负责人向财务部门解释的成本结构可直接追溯。
对于构建分布式VLA流水线的团队,PyTorch基金会的Ray现在可通过CKS直接部署到客户自己的CoreWeave账户,实现对CoreWeave AI对象存储中数据的完全控制,同时在加速计算资源上扩展训练和微调任务。
NVIDIA OSMO:物理AI的编排方案
在仿真领域,NVIDIA的OSMO是一个专为物理AI打造的开源编排器,可跨异构计算资源连接数据生成、训练、仿真和硬件在环测试。实际上,流水线中的GPU、CPU和专用仿真或机器人硬件在不同阶段往往差异显著,而OSMO负责协调它们之间的交接。
一个物理AI流水线可能在某种机器上生成合成数据,在GPU集群上训练模型,然后直接在真实传感器硬件上验证模型,而OSMO正是让这一流程保持统一工作流而非三个独立步骤的关键。
AI开发与实验
CoreWeave 为物理 AI 团队提供完整的开发和实验工具栈,该工具栈基于其收购的 Weights & Biases:用于实验跟踪的模型、用于从检查点追溯到生成它的具体数据和训练运行的版本化血统的注册表、用于追踪、评估和监控的 Weave,以及用于自动化研究流程部分工作的 ARIA(AI 研究和迭代代理)。目标是让每个 VLA 检查点、世界模型版本或 RL 策略都保持可追溯性,从而使回归调试耗时数小时而非数周。这是为 VLA、世界模型和 RL 策略优化的 AI 循环,而非针对聊天代理。
在原型设计和探索方面,CoreWeave 提供开源的反应式笔记本,该笔记本基于其 2025 年收购 marimo 后的集成,为工程团队(其中许多人首先是机器人专家和物理学家,而非 AI 工程师)提供比完整 ML 管道更轻量级的环境,以便进行早期迭代。
运维与可观测性
CoreWeave Mission Control® 将可观测性、舰队和节点生命周期管理以及安全审计可见性整合在一起,以确保大规模 GPU 舰队的可靠性。这对物理 AI 团队至关重要,因为在训练运行期间基础设施故障可能耗费数天而非数分钟。
舰队和节点生命周期控制器持续监控健康退化情况,并在达到阈值时自动替换节点,防止退化的节点在后台拖慢运行。在物理 AI 训练和仿真到现实验证等长周期分布式任务中,GPU 拖后腿检测利用 NCCL 级信号识别导致减速的具体排名、GPU 和节点,CoreWeave 的内部基准测试显示,自动化路径运行速度比传统手动调查快约 3 倍。当确实需要人工介入时,请求会直接路由到操作平台的工程师,而非支持队列从操作手册中读取信息。
工程能力:物理 AI 现场工程
CoreWeave 为物理 AI 客户提供工程能力,而不仅仅是基础设施,该能力基于其 2025 年 10 月收购 Monolith 后的集成。
物理 AI 现场工程从与客户团队的现场范围研讨会开始:绘制他们的工程工作流程,深入挖掘他们最大的痛点,并在任何模型构建之前就优先事项和现实时间表达成一致。从那里开始,我们不会提交一份报告然后退场,我们的工程师会与客户团队一起端到端地原型化解决方案,并持续参与直到该方案在生产环境中运行,而不仅仅是演示环境中运行。
- 战略。帮助识别哪些问题确实值得用 AI 解决,哪些数据值得构建。
- 仿真基础设施。帮助客户搭建其工作负载实际需要的 GPU、存储和仿真堆栈,并在需求扩展时连接到 CoreWeave 更广泛的物理 AI 基础设施。
- 真实世界数据。将分散的测试、传感器和生产数据转化为能够预测结果、检测异常或解释故障的模型,而不是让这些信号被埋没和未使用。
- 智能学习。将模型发现的内容转化为改变物理世界的事物:执行训练技能的机器人、在成为故障前被检测并纠正的故障、重新校准以更高效运行的系统。
客户获得的并非一份报告,而是一个经过其系统物理特性验证的模型,以及越来越多由该模型构建的代理程序,这些代理程序由客户直接运行。
图片由nTop提供
谁在基于CoreWeave构建
- NEURA Robotics在其NEURA Gym设施中每天运行一次物理AI循环:机器人尝试执行任务,团队评估结果,收集新数据,重新训练模型,在仿真环境中验证,然后再次在真实机器人上进行测试,整个过程通过W&B Models在基础训练、仿真和现实场景阶段进行端到端追踪。(阅读案例)
- Decart在CoreWeave上训练了Oasis 3,这是首个可通过API访问的世界模型,生成实时可控的仿真环境,使机器人能够在多视角自动驾驶和机器人场景中学习。(阅读案例)
- 丰田旗下Woven开发了AutoTriage,这是一个视频AI代理程序,通过Weights & Biases追踪实验并评估视频输入输出,实现自动驾驶开发中缺陷分类的自动化,使分类速度和规模提升10倍。(阅读案例)
- PhysicsX在CoreWeave云平台上训练大型物理模型,这些基于物理的模型可压缩航空航天、汽车、半导体、材料和能源领域的仿真和优化周期,并允许企业客户使用专有数据训练私有的、领域特定版本。(合作伙伴公告)
- nTop利用CoreWeave基础设施仅用32小时就完成了10,000次无人机机翼的大型涡模拟,提前四年实现了NASA CFD Vision 2030的扩展目标。(阅读案例)
- 日产将90多年的历史测试数据与车辆开发周期中的机器学习预测相结合;底盘螺栓接头测试的试点项目将物理原型测试减少了17%,预计在日产欧洲车型系列中的全面推广将使总测试时间减半。(阅读案例)
为什么团队选择CoreWeave
物理AI团队由机器人专家、仿真工程师和物理学家组成,而非云基础设施专家。在通用云平台上,这种差距会成为他们需要解决的问题,才能开展实际工作。CoreWeave已经为物理AI的持续性、计算密集型任务构建了专用基础设施,并由曾成功弥合仿真与现实差距的工程师团队提供支持。
当物理AI团队评估基础设施时,有三个因素通常最为关键:
- 长期任务的吞吐量。强化学习训练、视觉语言模型微调和世界模型运行可能需要数天或数周,而96%的可用计算能力意味着更少的时间浪费在虚拟化开销上。
- 从数据到部署模型的可追溯性。当现场策略失效时,团队需要追溯到生成该策略的确切检查点、训练运行和数据集,这正是Job Registry和Weave所设计的功能。
- 领域专业知识,而不仅仅是GPU。弥合仿真与现实的差距既是基础设施问题,也是物理和工程问题,这也是为什么现场工程是核心卖点而非附加服务。
在您的工作负载上亲自体验
/think
在 CoreWeave 上运行机器人、自动驾驶或工业 AI 工作负载,体验裸机 GPU、编排和现场工程带来的差异。与 CoreWeave 讨论具体项目,访问物理 AI 页面了解最新产品和客户案例,通过网络研讨会学习,或了解 AI 循环如何在 CoreWeave 运行的每个模型中应用观察、整理、改进、评估、运行的完整周期。
CoreWeave 的物理 AI 堆栈整合了计算、编排、工具和领域专家团队,专为机器人、自动驾驶和工业 AI 团队打造
分享本文: /