PyTorch Blog

Your Guide to Hardware Acceleration & Compute Infrastructure at PyTorch Conference North America 2026

8.5内容质量

TL;DR · AI 摘要

PyTorch 2026北美会议聚焦硬件加速与计算基础设施,涵盖TPU、Trainium等新硬件及TorchInductor等工具的深度优化。

核心要点

  • Trainium实现PyTorch原生支持无需代码修改
  • Helion编译器后端支持NVIDIA GPU与TPU统一编程
  • AMD FlyDSL在Instinct GPU上性能超越Triton

结构提纲

按章节快速跳转。

  1. 介绍2026年PyTorch会议硬件加速主题的全面覆盖。

  2. AWS展示Trainium原生PyTorch支持,Google Cloud演示TPU动态迁移技术。

  3. AMD提出FlyDSL新编译器后端,Meta发布Helion多硬件抽象框架。

  4. TritonCUTLASS Python提升GPU编程效率,PerfModel优化性能验证流程。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • PyTorch硬件加速进展
    • 2026会议重点
      • TPU/Trainium支持
      • 多硬件编译器
    • 关键技术
      • FlyDSL
      • Helion
      • Triton优化

金句 / Highlights

值得收藏与分享的关键句。

#PyTorch#硬件加速#编译器#TPU#GPU
打开原文

PyTorch 2026北美会议硬件加速与计算基础设施指南 – PyTorch

TL;DR

PyTorch 2026北美会议(2026年10月20-21日,旧金山)将汇聚大量关于如何让PyTorch在日益多样化的芯片架构(包括GPU、TPU、NPU和定制ASIC)上实现高效、可移植和可靠运行的专题讨论。

介绍

在本文中,我们将全面解析所有涉及硬件加速和计算基础设施的专题内容:内核工程、编译器后端、新型加速器(TPU、Trainium、Intel XPU、AMD Instinct、IBM Spyre、Arm)以及保障系统稳定运行的性能分析/可观测性工具链。

查看完整会议日程

注册参加PyTorch 2026北美会议

主题演讲

#### 赞助主题演讲:Trainium原生PyTorch之路

Maen Suleiman,亚马逊云服务 2026年10月20日 9:35–9:40 AM,大宴会厅

AWS将演示PyTorch如何在Trainium上实现无需代码修改的原生运行,涵盖即时模式、torch.compile以及与TorchTitan、TorchAO和Hugging Face Transformers v5的集成。

#### 智能体时代的工作负载可移植性

Bill Jia,谷歌云 2026年10月21日 9:15–9:25 AM,大宴会厅

谷歌云将展示生产环境中的TorchTPU,以及智能体工作流如何实现模型从GPU到TPU的迁移,并通过量化、内核生成和分片技术自主优化性能。

#### 研究时代的线性代数

Mark Saroufim,Core Automation 2026年10月21日 10:20–10:28 AM,大宴会厅

探讨当前开发的线性代数内核,解析这些长期存在的性能瓶颈为何仍然重要,以及AI工具如何加速相关技术突破。

内核工程与编译器:第一天

#### 通过FlyDSL扩展TorchInductor:面向高性能GEMM的新型MLIR原生后端

Liz Li,AMD 11:10–11:35 AM,210BF

AMD将展示FlyDSL——一个基于MLIR的GPU内核DSL,已集成到TorchInductor的GEMM编译流程中,并与Triton在AMD Instinct GPU上的性能进行对比。

#### Helion:面向异构硬件的CuteDSL与TPU后端,以及其对智能体的适配性

Oguz Ulgen,Dunfan Lu,Jason Ansel,Meta 11:45 AM–12:10 PM,210BF

Meta推出两款新型Helion编译器后端——面向NVIDIA GPU的CuteDSL和面向TPU的Pallas,使单个内核源码可适配不同硬件,并解析Helion的高层抽象为何适合LLM智能体编写的内核。

#### PyTorch开发者实用GPU编程(Triton)

Suman Debnath,JanakiRam Goteti,Crusoe AI 11:45 AM–12:10 PM,LL20CD

面向初学者的Triton GPU内核编写入门,从向量加法逐步构建到矩阵乘法,无需任何CUDA或C++知识。

#### 借助CUTLASS Python实现高速GPU内核开发

Michael Goldfarb,Guray Ozen,NVIDIA 12:20–12:45 PM,210BF

NVIDIA展示全新Python优先的CUTLASS特性——CuTe DSL扩展、底层硬件原语以及零成本异步调度器,让高级GPU内核开发更易上手。

#### PerfModel:面向Triton内核的验证驱动型性能模型

Xiaohu Guo,AMD 3:25–3:50 PM,210BF

AMD推出PerfModel——一个分析模型,可在JIT编译前预测AMD GPU的高性能Triton GEMM配置,降低穷举自动调优的成本。

#### JIT内核编译:如何为任何硬件编写快速内核

Stefan Lindall,Modular 4:20–4:45 PM,210BF

Modular 的 Mojo 语言、图编译器和硬件抽象概述,展示 MAX 如何自动将专为不同芯片(从 H100 到 TPUs 和 Trainium)设计的融合内核进行编译。

内核工程与编译器:第二天

#### 超越 Brrr:构建统一的优化内核生态系统

Sayak Paul, Hugging Face 11:10–11:35 上午, 210BF

Hugging Face 推出其内核库,使发现和替换优化的自定义内核变得像加载模型检查点一样简单,无需编写 CUDA 即可实现 2–5 倍加速。

#### 参数化动态形状 CUDA 图

Elias Ellison (Meta), Daniel Galvez (NVIDIA) 11:45 上午–12:10 下午, LL21ABC

新增支持跨动态形状捕获和重新参数化单个 CUDA 图,减少通常需要的全模型重写,缩短推理服务的冷启动时间。

#### 使用 Triton 内核在 Intel GPU 上加速 vLLM

Whitney Tsang, Artur Fierka, Intel 12:20–12:30 下午, 210BF

Intel 展示 Triton 内核策略——统一注意力、融合/批处理 MoE——在 vLLM 最热门的推理服务路径上,性能优于 Intel Arc GPU 上的 SYCL。

#### FlexGEMM:灵活的 PyTorch 后置操作

Driss Guessous, Meta 12:35–12:45 下午, 210BF

一项提议的 PyTorch 前端 FlexGEMM,允许开发者将 GEMM 后置操作(偏置、激活、残差)编写为普通 PyTorch 函数,编译器可将其融合到 GEMM 存储路径中。

#### 赞助:dmx-compressor:加速定制 ASIC 硬件内核开发

Tristan Webb, d-Matrix 12:35–12:45 下午, Community Expo

d-Matrix 演示了一个 PyTorch 2.0 量化框架,将 GPU 参考实现映射到 ASIC 内核库,可在开发早期发现硬件数值错误。

#### 赞助:为什么异构计算如此困难,又为何必须如此?

Jay Dawani, Lemurian Labs 1:50–2:00 下午, Community Expo

Lemurian Labs 讨论了为什么编译器和运行时抽象在 GPU、NPU 和自定义加速器之间会失效,以及真正硬件无关的栈需要正确实现哪些内容。

#### 推动 torch.compile 实现可验证精度与动态形状

Jing Li, Qi Guo, 华为 2:15–2:40 下午, 210BF

华为展示了集成到 Inductor 中的三级数值验证工具链和动态虚拟机,在 Ascend NPU 上进行精度检查和动态形状编译的基准测试。

#### 赞助:超越 torch.compile:通过设备持久张量减少 PyTorch 中的数据移动

Minwook Ahn, Rebellions 2:15–2:25 下午, Community Expo

Rebellions 展示了如何通过扩展 PyTorch 的设备抽象(Tensor.to(‘rbln’))实现设备持久张量,从而减少 LLM 服务中代价高昂的主机-设备传输。

#### 在 1K+ AMD Instinct MI355X 上扩展 MXFP8 预训练:TorchAO 内核与 TorchTitan 训练

Liz Li, Shekhar Pandey, AMD 2:15–2:40 下午, LL20AB

AMD 详细介绍了 TorchAO 中的 MXFP8 内核工作和 MI355X 上端到端的 TorchTitan 预训练,比较了 Triton 和 FlyDSL 实现,并分享了 MXFP4 的精度权衡。

#### 在 TPU 上进行 PyTorch 原生 LLM 服务:SGLang 和 vLLM

Colin Taylor (Meta), Qi Zhou (Google), Angela Yi (Meta) 2:15–2:40 下午, LL20CD

一个开源的原生 TPU 后端(torch_tpu),使 SGLang 和 vLLM 能在 TPU 上运行,同时保留其现有的调度器、批处理和 OpenAI 兼容 API。

#### 通向 ABI 稳定 PyTorch C++ 扩展生态系统的道路

Sean McGovern (Red Hat), Chris Leonard (Red Hat), Jane Xu (Meta) 下午2:15–2:40,LL21ABC

用于帮助C++扩展(如vLLM和SGLang)迁移到PyTorch稳定ABI的工具,终结每次PyTorch版本更新都会导致扩展失效并需要重新编译的循环。

#### PyTorch核心中的原生DSL算子

Simon Layton, Meta 下午2:50–3:15,LL21ABC

Meta将DSL编写的核心算子(如FlashAttention库所采用的模式)作为一级调度集成公民引入PyTorch核心。

#### 加速torch.compile:一种新的FakeTensor实现

Angel Li, Meta 下午4:55–5:05,LL21ABC

一种新的C++实现的FakeTensor,相比Python版本性能提升约30倍,显著缩短torch.compile的冷启动编译时间。

#### PyTorch中的轻量级FX追踪

Richard Zou, Yidi Wu, Meta 下午5:10–5:20,LL21ABC

一种基于make_fx的JAX风格轻量级FX追踪器,为函数式纯PyTorch代码提供比Dynamo更简单易学的全图使用方案。

#### 从Backed到Unbacked:PyTorch中更可靠可控的动态形状

Laith Sakka, Meta 下午4:20–4:45,LL21ABC

针对显式图捕获工作流(如vLLM和导出)提出使用Unbacked动态形状替代Backed形状的论点,以及历时一年半缩小性能差距的工作成果。

硬件后端与加速器可移植性:第一天

#### 传递与复用:PyTorch非树外发布就绪的双引擎

Jiahao Chen, Jiahao Tan, 华为 上午11:10–11:35,LL21DEF

华为描述如何通过设备无关的测试复用和跨仓库CI传递系统,使非树外硬件后端能在上游更新后30天内发布高质量PyTorch版本。

#### 赞助:Cloud TPU Nexus:用于PyTorch的自主多智能体集群

Sandeep Pokkunuri, Chris Jones, Google 上午11:45–12:10,210AE

Google推出Cloud TPU Nexus,这是一个多智能体系统,可自动将PyTorch模型从GPU迁移到TPU,通过调整编译器标志和内核,在不到一天的时间内达到接近手动调优的性能。

#### 赞助:PyTorch生态原生运行在Trainium上

Maen Suleiman, Amazon Web Services 上午10:55–11:05,Community Expo

实时演示在AWS Trainium上使用未修改的PyTorch工作流,端到端运行训练、服务、性能分析和自定义内核开发。

#### 赞助:使用TorchTPU在Google Cloud TPUs上统一开源LLM服务

Rob Mulla, Google 上午10:40–10:50,Community Expo

演示TorchTPU作为统一后端,使推理引擎如vLLM和SGLang只需少量代码修改即可在Cloud TPUs上部署最先进模型。

#### PyTorch泛化:迈向一次编写、处处运行的旅程

Yu Guangye, Eikan Wang, Intel 下午12:20–12:30,LL21DEF

Intel讨论PyTorch泛化工作,目标是实现与硬件无关的代码:API统一、新的torch.accelerator运行时API,以及跨后端验证一致性的测试基础设施。

#### 赞助:面向硬件的AI:使用PyTorch和ExecuTorch从云到边缘构建智能系统

Kavya Sri Chennoju, Arm 下午12:20–12:45,LL20CD

Arm演示一种从云到边缘的工作流,结合PyTorch、ExecuTorch、vLLM和Arm Device Connect,使基础模型能够调用边缘模型并协调物理硬件。

#### 使用TorchTitan和HuggingFace Transformers v5在AWS Trainium上通过TorchNeuron进行模型训练

Maen Suleiman(Amazon Web Services)、Michael Benayoun(Hugging Face) 下午3:05–3:15,LL21DEF

演示如何在Trainium上使用TorchTitan的并行计算技术大规模训练Hugging Face模型,无需修改模型代码,同时通过kernelize() API实现NKI内核加速。

#### 通过fastsafetensors实现更快速的LLM服务启动

Takeshi Yoshimura,IBM 下午3:25–3:35,LL20CD

IBM推出fastsafetensors开源库,通过将模型加载视为数据移动问题,使safetensors检查点加载速度提升4.8倍至7.5倍。

#### 赞助:从提示到物理动作:PyTorch与ExecuTorch的硬件感知AI实时演示

Kavya Sri Chennoju,Arm 下午3:55–4:05,Community Expo

实时演示LLM如何通过PyTorch、ExecuTorch、vLLM和Arm Device Connect进行任务推理、设备发现及真实硬件协调。

#### 赞助:量化对决:PyTorch推理优化

Markell Rawls,Red Hat 下午4:10–4:20,Community Expo

使用LLM Compressor和vLLM进行量化和推测解码的实时压力测试,展示生产环境中性能、成本和质量的实际权衡。

#### 超越尺寸和步长:通过设备感知张量布局释放性能

Olivier Tardieu、Matthew Arnold,IBM 下午4:20–4:30,LL20AB

IBM推出张量布局扩展,支持设备感知、分块和NUMA感知的物理布局,torch.compile(Inductor)可按目标设备自动适配。

#### 一个模型定义,多种加速器:在不分支的情况下通过vLLM跨硬件扩展

Thomas Parnell(IBM)、Richard Zou(Meta) 下午4:20–4:45,LL20CD

vLLM的硬件无关模型定义方法,将模型逻辑与执行路径解耦,演示支持Intel Gaudi/HPU和IBM Spyre而无需特定硬件代码。

#### 为数据流加速器解锁PyTorch:开源内核分块IR和数据流调度器

Prasanth Chatarasi(IBM Research)、Bardia Mahjour(IBM)、Viji Srinivasan(IBM Research) 下午4:55–5:20,210BF

IBM开源KTIR,这是一个基于MLIR的分块IR,包含针对IBM Spyre、Meta MTIA、TPU和Trainium等可编程数据流加速器的数据流调度器,已集成到TorchInductor中。

#### 跨AI加速器的可移植PyTorch:从Eager模式到vLLM的Triton操作符栈

Yonghua Lin,北京人工智能研究院 下午4:55–5:20,LL20CD

介绍FlagOS,这是一个基于Triton的操作符、编译器和运行时栈,已在20+ AI芯片上测试,实现了前沿开源模型在不同厂商硬件上的零日适配。

#### 在Arm上使用vLLM和OpenVINO进行高效的MoE LLM推理

Abhishek Jain、N Maajid Khan,印度富士通研究所 下午4:55–5:05,LL21ABC

富士通展示SVE优化的注意力机制、KV缓存量化和NUMA感知的MoE操作符,通过vLLM和OpenVINO在Arm CPU上实现MoE服务吞吐量翻倍。

#### IBM Spyre加速器的集成

David Grove(IBM)、Antoni Viros i Martin(IBM Research)、Avery Blanchard(IBM Research) 下午4:55–5:20,LL21DEF

IBM介绍Torch-Spyre,这是PyTorch的PrivateUse1后端,包含针对IBM Spyre数据流加速器的Inductor路径,包括设备专用张量布局和缓存优化分块。

#### XCCL:通过TorchComms在Intel GPU上将PyTorch集合扩展到Exascale

Panagiotis Kourdis、Tanima Dey,Intel 下午5:10–5:20,LL21ABC

Intel 详细介绍了 XCCL,这是一个基于 oneCCL 构建的 TorchComms 后端,在 Argonne 的 Aurora 超级计算机上运行 TorchTitan 时实现了超过 90% 的扩展效率。

#### TorchNeuron:AWS Trainium 上原生 PyTorch – 从研究到生产无需妥协

Yahav Biran,Annapurna Labs 5:30–5:40 PM,LL21ABC

介绍 TorchNeuron 的自适应即时执行、原生分布式训练以及 torch.compile 子模块编译功能,使研究人员能够通过简单的 .to('cuda') 切换为 .to('neuron'),无需代码重写。

#### 赞助:面向智能体 AI 的 PyTorch:从 CPU 到 XPU 的异构系统扩展

Eikan Wang,Huma Abidi,Intel 5:30–5:55 PM,LL21DEF

Intel 讨论了智能体 AI 工作负载对均衡 CPU/GPU 基础设施的需求,并详细介绍了其在 Xeon 处理器和 Intel GPU 上的上游优先优化方案。

#### 使用 ExecuTorch 构建可移植、可组合的本地智能体

Mergen Nachin,Digant Desai,Meta 5:45–5:55 PM,LL20CD

Meta 将 ExecuTorch 定位为本地智能体的运行时基座,支持在手机、工作站、嵌入式系统及未来私有智能体设备上实现内存高效的多会话服务。

硬件后端与加速器可移植性:第二天

#### TorchTPU:在 Google TPU 上原生运行 PyTorch

Claudio Basile,Google 11:10–11:35 AM,LL21ABC

Google 介绍了 TorchTPU 的即时优先架构、ATen 到 StableHLO 的降级以及“DeferAndFuse”执行机制,首次为 PyTorch 用户提供原生 TPU 支持,无需依赖 JAX。

#### 从 torch.profiler 到硬件周期:AWS Trainium 的实用性能分析指南

Esha Lakhotia(AWS Annapurna Labs),Pinak Panigrahi(Annapurna ML) 2:20–2:45 PM,LL21ABC

通过 torch.profiler 实现的实践分析工作流,从 nn.Module 层级追踪 Trainium 性能直至硬件周期级分辨率,并结合 AI 辅助瓶颈分析。

#### 赞助:AI Playground 家用智能体:通过手机远程控制本地 PyTorch AI 工作流

Ashok Emani,Qiacheng Li,Intel 1:00–1:10 PM,Community Expo

演示基于 Intel AI PC 的本地 PyTorch 生成式工作流,可通过手机远程控制。

#### 从 PyTorch 到边缘:面向异构硬件的智能体推理运行时合成

Thomas Cottenier,Arm 5:30–5:55 PM,LL20AB

Arm 展示了一个智能体框架,可根据边缘目标设备合成定制化推理运行时 – 结合 torch.export、ExecuTorch 后端和量化技术 – 已在 Apple 芯片和 Arm 硬件上验证。

查看完整议程

综合所有会议内容,这些议程清晰地展现了 PyTorch 2026 路线图的核心方向:硬件异构性不再是边缘案例,而是默认标准。从 TPU 和 Trainium 完全原生支持,到 AMD、Intel 和 IBM Spyre 后端实现深度 PyTorch 集成,再到专为可移植性设计的新编译器和通信原语(Helion、对称内存、NCCL 扩展、无后端形状) – 共同目标是让相同 PyTorch 代码在任何可用芯片上高效运行,无需厂商锁定或针对加速器的代码重写。

2026 年 10 月 20-21 日,加入我们在圣何塞的两天活动,了解如何在多样化的 AI 加速器和芯片生态中实现无缝可移植性、高级编译器与内核优化,以及可扩展的分布式基础设施。

2026年北美PyTorch大会现已开放注册。访问PyTorch基金会官方会议页面,完成注册并预订酒店。

/post-content

/inner-wrap /think