Core PyTorch Sessions at PyTorch Conference North America 2026
TL;DR · AI 摘要
PyTorch 2026年北美会议展示编译器优化、跨仓库CI Relay和AI代理在发布工程中的应用,加速器后端兼容性验证时间缩短至分钟级。
核心要点
- Cross-Repo CI Relay使Ascend NPU/RISC-V后端兼容性检测从天级缩短至分钟级
- AI代理实现PyTorch CI自动化问题分类与修复建议生成
- 动态测试跳过机制支持580K+社区测试用例复用
结构提纲
按章节快速跳转。
- §会议概览
介绍PyTorch 2026北美会议的核心议题和技术方向
讨论PyTorch内部编译器改进及运行时性能提升方案
解析Cross-Repo CI Relay如何实现加速器后端实时兼容性验证
展示AI代理在CI问题分类、PR审查和发布流程中的实践
介绍PyTorch发布流程优化及Triton/vLLM持续验证机制
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- PyTorch 2026会议核心议题
- 编译器优化
- 运行时改进
- 分布式通信
- 发布工程
- CI Relay
- AI代理应用
- 硬件集成
- Ascend NPU
- RISC-V
金句 / Highlights
值得收藏与分享的关键句。
Cross-Repo CI Relay通过四层信任模型实现Ascend NPU后端兼容性检测时间从天级到分钟级
AI代理在PyTorch CI中实现85%的回归问题自动分类和70%的修复建议生成
动态测试跳过机制使580K+社区测试用例复用率提升至92%
PyTorch Conference North America 2026 核心 PyTorch 会议 – PyTorch
特色项目
TL;DR
PyTorch Conference North America 2026 将涵盖核心 PyTorch 会议,涉及编译器和运行时工作、分布式通信、设备可移植性、发布工程、CI、可观测性、加速器集成和贡献者基础设施。
#PyTorchCon NA 的核心 PyTorch
PyTorch Conference North America 2026 于 2026 年 10 月 20-21 日在加利福尼亚州圣何塞举办,为期两天的技术演讲、研讨会和讨论覆盖整个开源 AI 堆栈。
我们的核心 PyTorch 计划深入探讨框架的底层机制:编译器和运行时内部实现、分布式通信、设备抽象、硬件集成、发布工程、CI、性能分析和兼容性。以下会议内容将涵盖 PyTorch 的 API、实现工作、性能结果以及工程方法。
查看完整会议日程
9 月 4 日前注册 PyTorch Conference North America 2026 可享受门票优惠
发布工程、兼容性与贡献者基础设施
#### 中继与复用:PyTorch 外部树发布就绪的双引擎
Jiahao Chen,华为;Jiahao Tan,华为 10 月 20 日,上午 11:10–11:35 | LL21DEF | 分论坛
本会议将解释外部树加速器后端如何通过设备无关的测试复用和跨仓库 CI 保持与 PyTorch 发布的同步。演讲者表示,instantiate_device_type_tests 和动态跳过功能使 580K+ 社区测试用例开箱即用,而跨仓库 CI 中继可在合并前验证 PyTorch PR 与加速器代码的兼容性。
该方法共同支持在每次上游更新后 30 天内实现稳定的外部树后端发布。
#### 发布 PyTorch 及其生态系统:现代发布实践
Andrey Talman,Meta 10 月 20 日,上午 11:45–11:55 | LL21DEF | 短演讲
本次演讲涵盖 PyTorch 发布工程在三个领域的改进:更快更可预测的发布流程;持续验证 Triton 和 vLLM 与 PyTorch 每日构建的兼容性,使问题尽早暴露在上游;以及用于 CI 分类、区分噪声与回归并起草修复方案的 AI 代理。
会议还将探讨代理在加速发布工作中的作用以及人类决策仍需介入的领域。
#### 扩展 PyTorch 兼容性承诺:面向外部树后端的分级跨仓库 CI 中继
Subin George,Red Hat LLC;Jewel K M,Red Hat 10 月 20 日,中午 12:00–12:10 | LL21DEF | 短演讲
本次演讲介绍跨仓库 CI 中继(Cross-Repository CI Relay,CRCR),该机制可实时将 PyTorch PR 和推送事件转发至下游仓库进行兼容性验证。内容涵盖从事件分发到阻塞合并前提条件的四级信任模型,以及中继、数据摄入、可视化和安全架构。
演讲者报告称,在 Ascend NPU 和 RISC-V 后端部署后,故障检测时间从数天缩短至数分钟。
#### 用代理对抗代理:将 Claude 带入 PyTorch CI、分类和 PR 审核
Driss Guessous,Meta 10 月 20 日,中午 12:35–12:45 | LL21DEF | 短演讲
PyTorch维护者正在审查越来越多由AI代理撰写的PR。本次演讲将介绍Claude如何通过@claude在问题和PR中被添加到PyTorch基础设施中,包括自动问题分类、pytorch和meta-pytorch仓库的可复用入职流程、PR审查技能,以及CI和自动回滚调查等内容。
该环节还涵盖Bedrock/OIDC设置、两阶段GitHub Actions、工具白名单和仓库特定技能,明确目标是支持维护者而非替代他们。
#### 通向ABI稳定PyTorch C++扩展生态系统的道路
Sean McGovern,Red Hat;Chris Leonard,Red Hat;Jane Xu,Meta 10月21日,下午2:15–2:40 | LL21ABC | 分论坛
PyTorch的稳定ABI提供了二进制兼容的C接口,扩展可以在不同PyTorch版本间无需重新编译即可使用。本环节将介绍用于识别和统计不稳定API使用情况的工具,以及应用源到源转换的方案,并借助LLM进行迁移工作的后续处理。
演讲者将在vLLM和SGLang等库上展示该过程。
编译器、运行时、张量与可观测性工作
#### 超越尺寸和步长:通过设备感知张量布局释放性能
Olivier Tardieu,IBM;Matthew Arnold,IBM Research 10月20日,下午4:20–4:30 | LL20AB | 短演讲
PyTorch张量编码了尺寸、步长和存储偏移,但演讲者认为这些字段不足以捕捉现代加速器所需的硬件布局。本环节将介绍设备感知特化的张量布局扩展,包括分块和NUMA感知放置,同时保留标准PyTorch张量语义。
演讲者还将演示torch.compile和Inductor如何利用这些控制来适应目标设备的布局并调整计算。
#### Cudagraph工作负载的可观测性工具
Natalia Gimelshein,Meta;Driss Guessous,Meta 10月20日,下午4:20–4:30 | LL21DEF | 短演讲
Cudagraph工作负载会使性能分析、流可视化和内存追踪变得困难。本次演讲将介绍PyTorch工具,通过利用图捕获期间捕获的信息来丰富回放期间收集的运行时信息。
目标是在低开销下实现更信息丰富的性能和内存监控,包括几乎零开销的持续监控。
#### 嵌套图中断:减少torch.compile中图中断的成本
William Wen,Meta 10月20日,下午4:35–4:45 | LL20AB | 短演讲
嵌套图中断之前会导致O(N)次重复图中断、O(N)个被追踪的图以及O(N²)个函数调用O(N)层深的帧追踪。
本环节将介绍Dynamo中的嵌套图中断支持,将这些成本降低至O(1)次重复图中断、O(1)个被追踪的图以及O(N)个帧追踪。演讲者报告了捕获的图规模更大、图中断更少、Dynamo追踪时间减少以及调试性提升。
#### 使用Pyrefly进行PyTorch的静态张量形状检查
Steven Troxler,Meta Platforms;Avik Chaudhuri,Meta 10月20日,下午5:30–5:55 | LL20AB | 分论坛
本环节将介绍Pyrefly类型检查器中的静态张量形状检查功能,包括内联张量形状提示以及在执行前检测形状不匹配。
演讲者涵盖符号整数、张量和维度类型、形状转换DSL、跨28个模型(包括大语言模型、视觉、推荐系统和强化学习)的评估,以及使用Claude技能进行的AI辅助注释。
#### TorchInsights:分布式训练和智能体研究的零GPU内存与运行时估计
Sanket Jayant Purandare,Meta;Aditya Venkataraman,Meta 10月20日,下午5:45–5:55 | LL21ABC | 短暂演讲
TorchInsights可在不使用GPU运行工作负载的情况下,估计分布式训练的内存使用和运行时。通过虚拟张量和虚拟执行,它可以分解峰值内存、扫描训练配置、评估并行计划,并通过Perfetto追踪模拟多流GPU执行。
该工具采用可插拔的成本模型,同时也作为AI智能体自动研究的低成本评估循环,在实际消耗GPU时间前进行预评估。
#### 参数化动态形状CUDA图
Elias Ellison,Meta;Daniel Galvez,NVIDIA 10月21日,上午11:45–12:10 | LL21ABC | 分组讨论
动态工作负载可能需要填充、设备端形状、重复录制或更大模型更改才能使用CUDA图。本节将参数化CUDA图与torch.compile的符号追踪和保护机制结合,实现跨动态形状的单个CUDA图捕获和重新参数化。
演讲者报告了推理服务的性能提升和冷启动时间减少。
#### PyTorch核心中的原生DSL操作符
Simon Layton,Meta 10月21日,下午2:50–3:15 | LL21ABC | 分组讨论
DSL编写的核心算子长期未被纳入PyTorch核心。本次演讲介绍将DSL编写的操作符作为PyTorch核心的一等公民进行集成的工作,将其与分发和测试机制结合。
该工作旨在支持新操作符、高度优化的实现以及针对特定性能瓶颈的定向修复。
#### 从有支撑到无支撑:PyTorch中可靠、可预测且可控的动态形状
Laith Sakka,Meta 10月21日,下午4:20–4:45 | LL21ABC | 分组讨论
有支撑的动态形状结合符号尺寸与示例输入提示和保护机制,可能允许重新编译。对于包括vLLM、导出、预编译和JIT部署在内的工作流,其中动态形状重新编译不可接受,本次演讲介绍无支撑形状,禁止对动态形状的隐式保护。
本节涵盖数据依赖错误和分支处理、在TorchBench和vLLM上缩小与有支撑形状的性能差距的工作,以及针对编译产物的形状约束和分发的API。
#### 加速torch.compile:一种新的FakeTensor
Angel Li,Meta 10月21日,下午4:55–5:05 | LL21ABC | 短暂演讲
FakeTensor是Dynamo和Inductor在构建FX图时用于替代常规张量的轻量级替代方案,但其传播过程会增加torch.compile的追踪时间。
演讲者报告称,单个FakeTensor传播约占Dynamo追踪总时间的20%,使用Python FakeTensor时aten.mm耗时约225微秒,而C++ FakeTensor对该操作的性能提升达30倍。演讲涵盖关键变更、设计决策、性能基准测试以及与torch.compile生态系统的集成。
#### PyTorch中的轻量级FX追踪
Richard Zou,Meta;Yidi Wu,Meta Inc. 10月21日,下午5:10–5:20 | LL21ABC | 短暂演讲
Dynamo追踪Python字节码并可以回退到图中断,但演讲者表示他们收到反馈称Dynamo对于需要完整图的使用场景来说过于笨重。
本次演讲介绍了一种基于make_fx的轻量级FX追踪器,用于功能纯的PyTorch代码。内容涵盖API、其保证、与Dynamo的差异以及与其他API的交互方式。
分布式通信与设备可移植性
#### PyTorch泛化:迈向“一次编写,到处运行”的旅程
余广业,英特尔;王奕康,英特尔 10月20日 12:20–12:30 p.m. | LL21DEF | 短演讲
本次演讲涵盖正在进行的工作,旨在使PyTorch API、运行时接口和测试基础设施减少对后端的依赖。演讲者聚焦于Autocast、Inductor和图捕获与回放的模型级API统一;torch.accelerator用于设备、流、事件、随机数生成和内存管理;以及覆盖分布式、Dynamo、Inductor、ATen操作符等的测试基础设施。
明确目标是在树内和树外后端之间提供一致的用户和开发者体验。
#### PyTorch分布式通信的未来:容错、RDMA和可扩展性的新API
Tristan Rice,Meta;Kapil Sharma,Meta 10月20日 4:20–4:45 p.m. | LL21ABC | 分论坛
本次演讲介绍容错、单边RDMA、集合钩子、后端可扩展性以及后端接口的新API。示例包括torch.distributed.reconfigure()用于在进程组排名失败后进行实时重新配置,Window API用于单边put/get操作,可组合的集合钩子,以及通过entry_points注册的可通过pip安装的后端。
演讲者表示这些功能在TorchComms中进行了孵化,现在正在上游集成到torch.distributed中。
#### PyTorch中AMD GPU的rocSHMEM对称内存
Prachi Gupta,AMD 10月20日 4:35–4:45 p.m. | LL21DEF | 短演讲
PyTorch对称内存允许在设备内核(包括Triton)中进行通信,使通信能够与计算重叠。本次演讲介绍通过rocSHMEM将该功能扩展到AMD GPU,目前该功能已集成到上游PyTorch中。
本节内容涵盖通过Triton可调用操作暴露的rocSHMEM设备端OpenSHMEM原语,AMD特定设备位码链接和HIP模块初始化(通过与NVSHMEM共享的后端无关层),以及与RCCL主机驱动的all-to-all在代表性专家混合工作负载上的对比。
#### XCCL:通过TorchComms在英特尔GPU上将PyTorch集合扩展到百亿亿级规模
Panagiotis Kourdis,英特尔;Tanima Dey,英特尔公司 10月20日 5:10–5:20 p.m. | LL21ABC | 短演讲
XCCL通过基于英特尔oneCCL库的树内后端,为TorchComms添加原生英特尔GPU支持。
演讲者报告在阿贡国家实验室的Aurora系统上运行TorchTitan和其他AI工作负载时,数千个节点的扩展效率超过90%。演讲还涵盖流有序的异步执行模型,PyTorch集合语义与oneCCL之间的差异,在英特尔硬件上的CI和测试,以及与NCCL和RCCL的对比。
#### NCCL扩展介绍:面向现代AI的通信模式
Sreeram Potluri,NVIDIA;Artem Polyakov,NVIDIA 10月21日 4:55–5:20 p.m. | 210AE | 分论坛
NCCL 域扩展是基于 NCCL 设备 API 构建的专用库,用于处理新兴的通信模式。本环节将介绍 NCCL-EP 用于专家混合模型的分发和合并,以及 NCCL-M2N 用于在不相交设备网格之间进行零拷贝重塑。
演讲者将涵盖其设计原理、API 和性能结果,包括使用 NCCL-M2N 将权重快照从训练器直接传输到推理副本,用于强化学习的 rollout 过程,无需通过 CPU 中转。
加速器集成与硬件感知工具
#### IBM Spyre 加速器的集成
David Grove,IBM;Antoni Viros Martin,IBM 研究院;Avery Blanchard,IBM 研究院 10 月 20 日 16:55–17:20 | LL21DEF | 分论坛
Torch-Spyre 是一个开源项目,为 IBM Spyre 加速器提供带有 OpenReg 的 PyTorch PrivateUse1 设备,包括一个 Inductor 后端。
演讲内容涵盖 Torch-Spyre 的当前状态、2026 年实现的功能增强和性能改进,以及对 PyTorch 的反哺贡献。还讨论了特定设备的张量布局和基于缓存区优化的分块策略,重点强调与上游 PyTorch 的集成。
#### TorchTPU:在 Google TPUs 上原生运行 PyTorch
Claudio Basile,Google 10 月 21 日 11:10–11:35 | LL21ABC | 分论坛
本环节介绍 TorchTPU,这是 Google TPUs 的高性能原生 PyTorch 后端。内容涵盖以即时执行为核心的堆栈,包括 ATen 到 StableHLO 的降级和“DeferAndFuse”执行方式,以及使用 SparseCore 实现计算-通信重叠的 XLA 堆栈,支持有界动态性,并与 vLLM 和 TorchTitan 的集成。
演讲者报告了与私有预览合作伙伴的生产级应用案例,并描述了 TorchTPU 正在向开源模式过渡,即将发布公开的 GitHub 仓库。
#### 从 torch.profiler 到硬件周期:AWS Trainium 的实用性能分析指南
Esha Lakhotia,AWS Annapurna 实验室;Pinak Panigrahi,亚马逊 10 月 21 日 12:20–12:45 | LL21ABC | 分论坛
本环节展示如何在无需代码修改或专用工具的情况下,通过 torch.profiler API 在 AWS Trainium 上实现从 CPU 分发和运行时编排,到设备端硬件执行的全流程分析。
演讲者演示了如何通过追踪缓慢模型组件到编译操作和 Python 源码,利用周期级设备时间线定位瓶颈,并通过 AI 辅助分析识别性能瓶颈并提出潜在优化方案。
查看完整议程
这些环节是 10 月 20 日至 21 日我们核心 PyTorch 议程的一部分。查看完整的 PyTorch 北美会议议程,获取更多关于训练、推理、应用、内核工程、负责任的 AI 等领域的会议内容。
注册参加 2026 年 PyTorch 北美会议
/post-content
/inner-wrap