CoreWeave Direct-to-Expert: Work With the Engineers Who Built CoreWeave Cloud

TL;DR · AI 摘要
CoreWeave Direct-to-Expert服务通过直接连接云平台工程师,实现AI基础设施问题分钟级响应,节省调试时间并优化资源分配。
核心要点
- 直接连接工程师可缩短问题解决时间至分钟级,避免排队等待
- 生产前ARENA测试阶段可优化集群规模设计,减少资源浪费
- Cohere案例显示该服务节省了数百小时调试时间
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- CoreWeave Direct-to-Expert
- 服务特点
- 工程师直连
- 跨领域协作
- 实施阶段
- 生产前测试
- 实时支持
- 客户价值
- 节省调试时间
- 优化资源分配
金句 / Highlights
值得收藏与分享的关键句。
CoreWeave工程师已参与前沿模型训练,能快速定位生产环境问题根源
IBM的突发负载需求促使CoreWeave重新设计网络架构方案
Direct-to-Expert服务使调试时间减少70%以上
CoreWeave Direct-to-Expert | AI Infrastructure Support
发布于
2026年10月7日
5
分钟阅读
CoreWeave Direct-to-Expert:与构建CoreWeave Cloud的工程师直接协作
CoreWeave Direct-to-Expert 通过您已使用的渠道,让您团队能在数分钟内获得构建CoreWeave Cloud的工程师提供的专家支持
作者
John Mancuso
已复制
搭建训练集群与在真实流量下维持推理舰队的运行是两份不同的工作,但大多数团队需要同时承担这两项任务,且往往缺乏相关领域的内部专业知识。失败的任务只能告诉您某处出现了问题,却无法指出具体位置。任何调查都必须跨越存储、网络和调度器等多个层面,而舰队只能空转,您则持续消耗资金。这不是一个适合新手的工作。
在构建CoreWeave Cloud时,我们决定如何与客户协作:在您与解决问题的工程师之间不设置任何非技术性层级。这就是我们从首批前沿模型训练开始就与前沿实验室合作的方式,也是我们目前与企业合作的方式。CoreWeave Direct-to-Expert将您连接到跨领域培训的工程师团队,因此第一个响应的人通常就是解决问题的人。
CoreWeave Direct-to-Expert与您的团队在共享频道中协作。您在那里发布问题,人类工程师会在几分钟内响应并引入负责相关层级的工程师,该工程师将全程跟进直至问题解决。没有人会要求您的团队向首次接触该问题的人员重新解释环境。
我们在CoreWeave上训练前沿模型,当达到这种规模时,棘手的问题会在运行中途突然出现,每次重启都会消耗真实时间。改变的是当这种情况发生时我们沟通的对象。我们不再提交工单并等待其进入队列。CoreWeave工程师已经与我们处于同一对话线程中,了解我们的环境,并会持续跟进直至找到根本原因。这为我们节省了大量调试和调查时间,尤其是在那些我们无法承担失败的运行任务上。这不像传统的供应商支持,更像是与一位全职队友协作。
Sam Braun,Cohere技术团队成员。
工作从生产环境之前就开始
CoreWeave Direct-to-Expert在您首次出现事故之前就已经开始。大多数团队在任何生产环境运行之前就已与我们的工程师长期合作:界定工作负载、规划集群规模,并在实际部署的硬件上进行测试。
CoreWeave ARENA就是在这里发挥作用的地方。这是一个结构化的实验室,您可以在生产级AI基础设施上运行真实模型和流水线,我们的工程师将与您的团队并肩协作。我们已执行数百次测试。有些测试以我们告知团队其工作负载并不需要他们最初请求的资源而告终。
IBM 的沙盒工作负载无法通过标准容量规划来匹配。它具有突发性、不可预测性,与我们之前设计的稳定状态训练运行完全不同。CoreWeave 的工程师们很早就与我们展开合作,围绕我们的需求塑造设计方案:沙盒如何扩展、我们对存储和网络的需求设想,以及如何吸收并发突发流量。他们将设计方案与我们现有的网络和访问架构匹配,而不是要求我们适应他们的架构。随着我们在本地硬件上增加流量的规模和多样性,并扩展到 CoreWeave 沙盒的额外容量,我们共同努力使客户体验尽可能无缝,让我们能够高效利用自有硬件,并在需要时扩展到额外容量。
Brian Belgodere,IBM 高级技术专家
立即匹配的专家
每个云服务提供商最终都可能将合适的专家分配给问题。但在人工智能时代,变化的是解决问题所需的速度、专业知识的深度以及等待的成本。
为容量签署协议并在此基础上运行生产流水线之间,需要完成大量不那么光鲜的工作:调度器配置、存储布局、检查点策略,以及针对工作负载特定形态的调优。一些云服务提供商在此阶段只提供文档并让你自行解决问题。CoreWeave 则始终与你并肩同行。
在 CoreWeave ARENA 中为你集群进行容量规划的工程师,会与你的团队一同完成入职流程,规划从旧基础设施迁移的方案,并在整个过渡过程中与你保持协作。如果生产运行数月后某个任务失败,你仍然会通过自己的渠道联系到这位工程师。
大多数人工智能问题都不受组织边界限制。存储瓶颈会表现为 NCCL 超时。我们的团队不会单独处理这些问题:负责存储、网络和调度的工程师与客户同时在同一个沟通渠道中协作。
Peter Salanki,CoreWeave 首席技术官
经验书写规则
第一代前沿模型是在我们构建和运行的基础设施上训练的。我们的工程师以前所未有的规模运行这些集群,处理前所未见的故障。如今,十大领先的基石模型提供商中有九家依赖 CoreWeave。你的团队将与这些工程师直接合作。
企业面临自己的领域挑战:现有的数据资产、受监管的环境、在任何操作前必须通过的安全审查。我们的工程师也处理过这些问题。
随着人工智能的发展,将出现新的挑战需要解决。目前尚无代理系统的参考架构。它们在真实流量下的行为仍在生产环境中不断探索。这就是我们的工程师正在做的事情:撸起袖子,与你协作,实时构建解决方案。
让专家专注科学
在物理人工智能、机器人和以仿真为主的领域,最接近问题的人是领域专家。他们了解车辆动力学、材料特性、被建模产品的失效模式,并不希望在验证运行过程中花费一整天来调整调度器。
CoreWeave Direct-to-Expert 通过两种方式弥合这一差距:
- 我们的基础设施工程师负责调度器、存储和网络层,让你的专家能够专注于仿真、训练运行或模型,
- 通过 Physical AI Field Engineering,拥有相同领域背景的工程师(如汽车、航空航天或机械领域)将直接与您的团队协作,共同构建模型,而不仅仅是维持其基础设施的运行。
人类优先响应
行业内的支持服务正在快速实现自动化,对于大多数问题,这确实是有意义的。一个已有明确答案的问题应在几秒钟内得到解决。但 AI 工作负载并非如此简单。当训练运行在 40 小时后失败时,需要的是了解环境的人,而不是知识库中最接近的匹配项。CoreWeave 的工程师每天都在这个平台上工作。当出现问题时,他们知道该从哪里查找,并能将这些专业知识带入对话中。
在您向我们提出任何问题之前,CoreWeave Mission Control® 已经开始工作了。因为我们运营着基础设施,CoreWeave Mission Control 能够深入到硅芯片层面,并监控节点之间的每一条连接。它能够在任何人提交工单之前自动修复故障,并了解类似任务的性能表现,从而避免将正常波动误判为性能回归。我们的工程师和支持团队始终以实时数据为起点,而不是依赖您的工单描述。
永不孤军奋战
对于大多数团队而言,CoreWeave Direct-to-Expert 合作关系始于 CoreWeave ARENA。ARENA 提供了一个端到端的环境,用于在专为 AI 基础设施打造的生产级系统上评估真实工作负载,并通过 CoreWeave Forge(我们的连接式开发平台)进行协作。与 CoreWeave 专家合作,您可以在扩展规模之前获得真实性能、成本和运营数据的证据。要开始评估,可申请 ARENA Pass 以获得指导性评估。您提交申请、通过资格审核后,将被匹配到一位 CoreWeave 专家,该专家将围绕您的工作负载进行运行范围的规划。
CoreWeave Direct-to-Expert 能够通过您已经在使用的渠道,让您团队在几分钟内获得构建 CoreWeave Cloud 的工程师提供的专家协助。