PyTorch Blog

A Ray-Focused Guide to PyTorch Conference North America

8.5内容质量

TL;DR · AI 摘要

Ray框架成为AI基础设施标准,与Kubernetes整合构建统一AI栈,LinkedIn展示三层PyTorch训练架构。

核心要点

  • Ray与Kubernetes协同进化是AI基础设施核心趋势
  • LinkedIn使用Ray构建三层异构训练栈提升20%训练效率
  • 生产环境需通过零拷贝桥接分离GPU与CPU数据处理

结构提纲

按章节快速跳转。

  1. 2026年PyTorch北美会议聚焦Ray框架在AI基础设施中的应用。

  2. Ion Stoica展示下一代AI计算栈的协同进化方向。

  3. ›LinkedIn实践案例

    三层Ray架构实现异构计算资源弹性调度与数据加载分离。

  4. 通过零拷贝桥接技术实现GPU与CPU节点的高效数据传输。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Ray与AI基础设施
    • Kubernetes整合
      • 统一AI计算栈
      • 生态协同进化
    • 生产实践
      • LinkedIn三层架构
      • 零拷贝数据传输

金句 / Highlights

值得收藏与分享的关键句。

#PyTorch#Ray#Kubernetes#分布式计算#AI基础设施
打开原文

以 Ray 为中心的 PyTorch 北美会议指南 – PyTorch

精选项目

TL;DR

仅在数周之后,PyTorch 会议北美 2026 年度将正式在圣何塞拉开帷幕,汇聚开源 AI 社区分享理念并协作。如果你曾听说过 Ray 但从未深入探索,今年将是契机,因为越来越多团队希望在自身安全且受控的 AI 基础设施上扩展 AI。Ray 是一个分布式计算框架,帮助团队扩展任何 AI 框架、库或模型。它为开发者提供统一的接口,从整理 PB 级多模态数据,到跨多节点训练模型,再到在虚拟机或 Kubernetes 管理的集群中部署生产环境。这种覆盖完整 AI 生命周期的能力,也是 Ray 成为 Cursor、微软 AI 和 NVIDIA 等实验室进行训练后处理和强化学习(RL)的标准底层框架的原因。无论你是首次接触分布式 PyTorch 还是已在生产环境中运行 Ray,这里都有你值得安排日程的会议指南。

开源 AI 计算堆栈

主题演讲:与 Kubernetes 共同演进迎接 AI 时代 Ion Stoica,Anyscale / Databricks / UC Berkeley · 周二 9:35 AM · 大宴会厅

Ray 共同创始人 Ion Stoica 将发表主题演讲,探讨 Ray 与 Kubernetes 在 AI 时代的发展方向。

跨越鸿沟:Kubernetes 与 Ray 在 AI 时代的协同演进 Jago Macleod,Google,Ion Stoica,Anyscale / Databricks / UC Berkeley · 周二 2:50 PM · 210BF 会议室

当前 AI 工作负载编排领域被分割成两个平行宇宙:CNCF(云原生和现代基础设施的基石)与 PyTorch 基金会(AI/ML 创新的中心)。尽管这两个基础架构独立运作,但终端用户没有选择权。PyTorch 基金会包含 PyTorch、vLLM、Ray 等,而 CNCF 拥有 Kubernetes、Envoy、OpenTelemetry、llm-d、containerd 等。要构建、部署和扩展现代 AI 应用,用户需要两个生态系统的项目无缝集成。本节将探讨连接这两个社区的关键桥梁:Kubernetes 与 Ray 协同演进为统一的开源 AI 堆栈。我们将讨论 Google 与 Anyscale 如何与更广泛的社区合作,共同构建一个开放、垂直整合的堆栈,防止生态系统碎片化。

生产级数据整理与模型训练

一路到底:LinkedIn 的异构弹性 PyTorch 训练架构 Tommy Li,Tao Huang,LinkedIn · 周二 3:25 PM · 210AE 会议室

如果你想了解如何具体扩展 PyTorch 超出单机规模,这将是必参会的环节。LinkedIn 团队展示了基于 Ray 的三层训练架构:基于 Ray Actor 的数据加载库,流式传输 Avro、Parquet 和 Iceberg;叠加 FSDP、HSDP、弹性扩展和异步检查点的 Ray Train 框架;以及按需集群供应平台。核心启示?通过专用 CPU 节点的零拷贝桥接将数据加载与 GPU 分离。这使数据加载器内存减少了 50-70%,在某些场景下甚至需要绕过 Ray 来回收 24% 的步骤时间。该用例实用、具体且可复用,远超 LinkedIn 架构的适用范围。

Uber Eats 推荐的 PyTorch 原生特征转换和训练框架 Peng Zhang, Ke Chen, Xandra Zhu, Uber · 10 月 21 日 · 下午 4:55–5:20 · LL20CD 会场

Uber 在将 Eats 推荐系统从 TensorFlow/Horovod 迁移到 PyTorch 的演讲中,重点展示了 Ray Data 作为重构的核心组件,用分布式特征统计计算和零拷贝批量转换替代了基于 Spark 的传统预处理流程。成果令人印象深刻:数据转换速度提升 5 倍,内存使用降低 90%,训练吞吐量提升 20 倍。

用 Ray 扩展 LLM 服务层

Ray 不仅在今年支持了专用训练会话,还作为关键基础设施出现在以不同重点为主题的演讲中:

保持 GPU 高利用率:通过 fsspec 为 PyTorch 提供高速存储 Ankita Luthra, Trinadh Kotturu, Google · 周二 下午 3:40 · LL21DEF 会场

瓶颈已从计算转向存储:GPU 在等待基于传统 REST 的数据访问时处于空闲状态。提出的解决方案 Rapid Storage 通过 fsspec 为 PyTorch 引入了高吞吐量的 gRPC 协议。据团队介绍,这一改进不仅适用于 Ray,还惠及 Dask、HF Datasets 和 vLLM 等整个 fsspec 生态系统。如果你的 Ray Data 管道受存储限制,这场演讲值得参加。

从 PyTorch 到生产:通过 ONNX、Ray 和 vLLM 服务物理约束生成模型 Arun Sharma, 明尼苏达大学 · 周二 下午 2:50–3:15 · 210AE 会场

一个关于物理约束生成模型(PC-RF,一种用于气候降尺度的条件修正流模型)的深度工程实践,从训练到部署的完整生产栈。演讲内容涵盖通过两种方式导出 ONNX 模型、在图外运行流匹配采样器、在推理时强制执行物理约束。Ray 作为训练方案的一部分被用于模型扩展,服务路径则扩展到 ONNX Runtime、Temporal 和 vLLM 代理。

基于 Ray 的微调与强化学习

为不拥有训练循环的团队构建微调平台 Gaurav Arora, Shunyao Li, Eric Wang, Pinterest · 周三 下午 3:25–3:50 · LL20CD 会场

随着 Pinterest 各团队(SFT、DPO、GRPO 在视觉语言模型上)扩展微调工作,每个团队都构建了自己的技术栈:不同的框架、数据格式和分布式策略。团队需要数周时间将开源框架与内部基础设施集成才能完成一次训练。我们传统的 ML 平台(MLEnv)管理 PyTorch 训练循环并实现了 95% 的采用率。微调打破了这一局面:现在训练循环存在于快速迭代的开源框架中,每月发布新方法。我们构建了 PTEvn——一个管理 PyTorch 微调生命周期的框架,涵盖循环周围的所有内容(数据、编排、扩展、评估、导出),而将内部循环委托给开源框架。相同的接口支持通过 Ray 实现 RL 的子进程执行,或通过 PyTorch FSDP/DDP 使用 MS-Swift 实现进程内 SFT——框架选择只需一行配置,无需重写代码。这场演讲将涵盖框架架构、大规模 VLM 训练的生产难点(权重同步瓶颈、MoE 解决方案)、真实工作负载的微调优化,以及使用 LLM 作为裁判的框架无关评估。这是为支持多任务微调的平台团队提供的实用演讲。

SkyRL:民主化可扩展的强化学习训练 Sumanth Hedge, Eric Tang, Anyscale · 10 月 20 日 下午 4:55–5:20 · LL20A 会场(下层)

Agents 在 2026 年成为技术焦点,越来越多的企业对使用强化学习训练定制化智能体(agent)表现出浓厚兴趣。随着智能体交互场景向长周期、多轮次演进,底层训练基础设施在系统挑战和性能要求方面也面临新的变化。SkyRL 是一个模块化、高性能的强化学习库,专为满足日益增长的定制化和可扩展性需求而设计。本次演讲将追溯 SkyRL 的发展历程——从最初基于 Ray 的模块化 API 体系(将训练、推理和环境解耦并协同调度),到如今的演进方向。主要内容包括:

  • SkyRL 如何通过 Megatron 和 vLLM 在 3500 亿参数的 MoE 模型上实现可扩展的全异步强化学习训练
  • SkyRL 的多租户 Tinker 引擎,使研究人员能够高效利用自有硬件进行强化学习训练,同时通过 Tinker 灵活的训练 API 快速迭代训练方案
  • SkyRL 向基于 HTTP 协议的 API 重构以实现可扩展推理,以及我们为 vLLM 贡献的原生强化学习 API
  • 基于 SkyRL 构建的社区方案,涵盖长周期任务的大型 MoE 训练、定制化递归语言模型等场景

Demo Theater

为大规模微调优化 Ray Core 架构 Mengjin Yan(Ray Core),Josh Lee,Anyscale · 10 月 21 日 15:55-16:05 · 社区博览会(Concourse 层)

在微调任务执行任何训练步骤之前,训练器和推理引擎必须先被调度到集群中,之后每一步都需要在组件间传输最新的模型权重。Ray Core 的演进直接源于其支撑的业务负载,其设计深受微调社区对更高可扩展性和更强性能的核心需求影响。Ray Core 持续的工程优化直接解决了这些需求,使其成为 SkyRL、Miles 和 NeMo RL 等微调框架底层的关键开源运行时。本次分享将介绍 Ray Core 的核心构建模块,并演示它们如何映射到活跃的微调工作流。我们将重点分析其可扩展性突破,包括 Ray 在万节点集群上的调度扩展能力,以及 Ray Direct Transport 等性能优化技术(实现 GPU 间 PyTorch 张量的直接传输)。最后将概述 Ray Core 的未来开发路线图,并介绍社区成员参与贡献的实践方式。

开发者面对面

周二 · 15:50-16:25 · 社区博览会

加入 Ray 专家的互动“开发者面对面”环节,在小组交流中学习并提出您最关心的问题。

了解 Ray 在 PyTorch 北美大会的完整内容

综合来看,这些分享讲述了一个清晰的故事:Ray 已从单纯的扩展性库演进为覆盖编排、训练、数据加载、存储和可观测性的基础架构体系。如果您正在基于 PyTorch 构建 AI 基础设施,千万不要错过 PyTorch 北美大会的 Ray 专题内容。

[查看完整日程](#) [立即注册 PyTorch 北美大会](#)

/post-content /inner-wrap