PyTorch Blog

Driving the Future of Open Source AI: An Update from PyTorch Foundation Projects

8.5内容质量
Driving the Future of Open Source AI: An Update from PyTorch Foundation Projects

TL;DR · AI 摘要

PyTorch基金会宣布成立多项目基金会,PyTorch 2.13发布显著优化性能,vLLM推出Model Runner V2并公布2026路线图。

核心要点

  • PyTorch 2.13在Apple Silicon上实现FlexAttention性能提升至SDPA的12倍
  • vLLM完成Model Runner V2重构,GPTQ模型性能显著优化
  • PyTorch基金会整合6大项目,涵盖硬件支持与社区健康度管理

结构提纲

按章节快速跳转。

  1. PyTorch基金会转型为多项目协作平台,整合6大核心项目。

  2. 发布包含FlexAttention、CuTeDSL后端及内存优化等关键特性。

  3. ExecuTorch进展

    通过与Hugging Face合作推进设备端LLM能力扩展。

  4. ·vLLM里程碑

    实现双周发布节奏,Model Runner V2重构提升GPTQ性能。

  5. 聚焦智能体工作负载、KV缓存压缩及生产级推理优化。

  6. 举办vLLM会议推动硬件后端与智能体服务技术交流。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • PyTorch基金会项目更新
    • 核心项目进展
      • PyTorch 2.13性能优化
      • ExecuTorch设备端LLM扩展
      • FSDP2通信重叠技术
    • vLLM技术突破
      • Model Runner V2重构
      • 2026路线图规划
      • vLLM会议举办
    • 生态建设
      • 跨领域协作机制
      • 硬件支持扩展
      • 社区健康度管理

金句 / Highlights

值得收藏与分享的关键句。

#PyTorch#开源AI#模型优化#DeepSpeed#vLLM
打开原文

驱动开源AI的未来:PyTorch基金会项目进展更新 – PyTorch

重点项目

重点摘要

2025年4月,PyTorch基金会演进为多项目基金会,目标是促进跨领域更深入的协作,并帮助在整个AI生命周期中扩大创新规模。目前,基金会托管六个项目,包括PyTorch、vLLM、DeepSpeedRay、Helion和Safetensors。从核心优化更新到硬件支持和社区健康,PyTorch基金会托管的项目在本季度取得了显著进展。在本系列新博客中,每个项目都将汇报其最新成果。

PyTorch更新:2.13版本发布、ExecuTorch和苹果芯片优化

核心PyTorch项目开发势头依然强劲。仅在第二季度就提交了4,415次代码变更,问题管理进展顺利,开放问题总数持续下降。

社区正式发布了PyTorch 2.13,并已启动PyTorch 2.14的开发周期。PyTorch 2.13重点提升性能和平台覆盖范围:FlexAttention首次在苹果芯片上实现(速度较SDPA提升约12倍),新增CuTeDSL Inductor后端,内存优化的nn.LinearCrossEntropyLoss(峰值GPU内存减少达4倍),以及支持Python 3.15轮子包(包含免费线程构建)。在分布式和平台层面,新增torchcomms后端和FSDP2通信重叠功能用于大规模集群训练,扩展了ROCm/Arm/Intel XPU支持。团队正通过ExecuTorch积极扩展设备端LLM能力,每周发布示例,并与Hugging Face合作优化模型导入和设备端性能支持。

vLLM更新:Model Runner V2、2026年第三季度路线图和vLLM会议

vLLM项目达成重要里程碑,实现稳定的双周发布节奏。其关键成就是对Model Runner V2的全面重构,在GPTQ上带来显著性能提升。vLLM继续为Kimi K3、Minimax M3和Qwen 3.8等超大规模前沿模型提供零延迟支持。

展望未来,团队发布了2026年第三季度路线图。路线图按特别兴趣小组(SIG)划分,聚焦生产级智能体工作负载和高交互性付费令牌。在核心引擎方面,团队正在完成Flat Model和Model Runner V2两大迁移,并重新设计调度器和KV缓存的工作方式。针对大规模服务,目标是在AgentX上实现顶级性能,改进KV缓存卸载和多轮智能体的智能前缀缓存。其他小组专注于更快的推测解码、生产级KV缓存压缩和更快速的CI流程。还有专门的模型性能优化(vLLM-Omni)和强化学习路线。

团队还举办了首届vLLM会议,于8月24-26日在旧金山Ray Summit举行。该活动汇聚了vLLM生态系统中的工程师和研究人员,两天议程涵盖vLLM路线图、硬件后端、智能体服务、训练和生产级推理等主题。

DeepSpeed更新:Ulysses并行、Torch.xpu集成和ASPLOS 2026

DeepSpeed 持续推进软件创新,保持每两周一次的稳定发布节奏,在第一季度已推出六次软件更新。为加强与开发者的协作,团队将每月虚拟办公时间稳定为社区互动的固定节点。在架构层面的重大升级中,项目移除了对 Intel GPU 的支持(IPEX),转而直接集成 Torch.xpu。团队还推出了多项更新,包括混合精度修复、AMD SDMA 优化、自动序列并行以及 Muon 优化器。

该项目的主要亮点之一是将 Ulysses 序列并行算法直接集成到 Hugging Face 库中,涵盖 Trainer、Accelerate 和 TRL 等组件。DeepSpeed 的理论贡献也获得学术界认可,在 ASPLOS 2026 会议上,其开创性的 SuperOffload 工作获得最佳论文荣誉提名,并有三篇研究论文被接收。其中第一篇论文(AutoSP)利用 PyTorch 2.0 编译技术实现序列并行自动化,第二篇论文探讨了 Grace Hopper C2C 系统上的能耗分析与卸载开销,第三篇论文则聚焦模型训练中的高效卸载机制。

Ray 更新:GB200/GB300 硬件支持、前沿模型扩展与 Ray Data 2.57

Ray 专注于大规模工作负载的生产级优化,包括加速 Actor 调度、升级原生 RDMA 支持、改进拓扑感知调度以实现机架感知的 Actor 布局,以及增强对 GB200/GB300 及更高版本硬件的支持。团队还致力于优化强化学习、多模态数据和视频处理的工作流。

过去几个月中,Ray 被用于构建多种前沿模型,包括 MAI-Thinking-1、Composer 2.5 和 Nemotron 3 Ultra。

团队的其他近期亮点包括通过 Ray + vLLM 提升推理性能、通过资源隔离提高集群稳定性、增强数据管道可靠性,以及在 AMD MI325X 上通过 Ray + vLLM 实现预填充-解码分离。

团队还对数据和推理管道进行了重要更新。全新的高性能 Ray Data 引擎计划在 2.57 版本中发布。同时,团队正积极与 vLLM 和 SkyRL 集成权重同步功能,以消除微调后的性能瓶颈。若想与团队及社区线下交流,Ray Summit 会议将于 8 月 24-26 日在旧金山举行。

Helion 更新:跨硬件注意力内核与 LLM 指导的自动调优

Helion 在今年前六个月取得显著进展,专注于在异构硬件上实现顶尖性能。项目推出了用于 NVIDIA GPU 的 CuTeDSL 后端和用于 TPU 的 Pallas 后端。借助新的 CuTeDSL 和 Pallas 后端,通过相同的 Helion 注意力内核,Helion 在 NVIDIA Blackwell GPU 上的性能超越 FlashAttention-4,在 Google TPU 上的性能超越 Tokamax 库的手写注意力内核,展示了 Helion 的性能可移植性。Pallas 后端由 Google 合作开发,并在 Google AI 系统开发实验室(DevLabs)首次亮相。

除了性能提升和对新硬件的支持,Helion 将大语言模型(LLMs)的能力融入内核自动调优中。团队近期推出了一个由大语言模型引导的自动调优器,显著加速了自动调优过程,展示了调优效率提升 10 倍的成果,为更快、更高度优化的部署铺平了道路。

为与社区互动,Helion 与 NVIDIA 和 GPU Mode 合作举办了首次黑客马拉松,并在 PLDI 会议上开设了教程。Helion 在 PyTorch 欧洲会议上正式宣布进入通用可用阶段(General Availability)。

Safetensors 更新:无 GIL 序列化、Python 3.14 支持与 MPS 快速加载

6 月,Safetensors 官方推出了无全局解释器锁(GIL)序列化功能,引入增强的并行处理能力以提升整体多线程性能。为提前支持即将发布的 Python 版本,该项目已扩展其持续集成流水线以兼容 Python 3.14 和 3.14t。对于使用兼容硬件的开发者,新的金属性能着色器(MPS)快速加载路径在 PyTorch MPS 后端引入原生金属缓冲区,显著降低模型加载延迟。最后,新增的 dtypes 为开发者在各种建模工作负载中提供了更高的精度和灵活性。

展望未来,Safetensors 正在积极优化 CUDA 快速路径加载能力,探索与 io_uring 和 GPU Direct Storage(GDS)的集成。作为初步步骤,项目正在实现多线程预读操作到固定主机缓冲区,以加速数据传输。这项结构性工作旨在使库显著更适应额外的自定义快速路径,同时摆脱对框架管理存储的历史依赖,例如 PyTorch 中的 from_file 内存映射。团队目前正在评估此过渡的可行性,因为这取决于可能并非所有框架都普遍支持的 DLPack 传输。

加入社区

你准备好与我们共同构建人工智能的未来了吗?要了解更多关于我们的托管项目信息,请访问我们的 托管项目门户;要了解您的组织如何成为成员,请访问我们的 加入我们页面。此外,今年晚些时候,欢迎参加 2026 年 9 月 7-9 日在上海举办的 KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China,以及 2026 年 10 月 20-21 日在圣何塞举办的 PyTorch Conference North America。