PyTorch Blog

vLLM Sessions at PyTorch Conference North America 2026

8.5内容质量

TL;DR · AI 摘要

PyTorch 2026北美会议聚焦vLLM在KV缓存优化、硬件适配和生产服务中的技术突破,包含多个开源工具和架构方案。

核心要点

  • vLLM通过KV Push技术使首token生成时间降低30%
  • LMCache实现跨引擎的集群级提示缓存方案
  • vLLM支持异构张量并行的混合模型传输

结构提纲

按章节快速跳转。

  1. 介绍PyTorch 2026北美会议的基本信息和vLLM技术主题分布

  2. 解析vLLM在KV缓存传输和分级卸载方面的技术实现

  3. 讨论vLLM在混合专家推理和集群级缓存方案中的应用

  4. 阐述vLLM如何实现跨硬件平台的内核优化和性能提升

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • vLLM技术进展
    • KV缓存优化
      • KV Push传输
      • 分级卸载框架
    • 生产服务
      • 混合专家推理
      • LMCache集群缓存
    • 硬件适配
      • 异构并行支持
      • 跨架构兼容性

金句 / Highlights

值得收藏与分享的关键句。

#PyTorch#vLLM#KV缓存#LLM推理#开源工具
打开原文

vLLM 在 2026 年北美 PyTorch 大会 – PyTorch

精选项目

TL;DR

2026 年北美 PyTorch 大会将涵盖多个与 KV 缓存管理、分散式服务、硬件可移植性、内核优化、PyTorch 集成、专家混合推理、注意力机制和生产服务相关的 vLLM 主题演讲。

vLLM 在 #PyTorchCon NA

2026 年北美 PyTorch 大会将于 10 月 20 日至 21 日在加利福尼亚州圣何塞市举行,包含技术演讲、实时演示、闪电演讲、赞助环节、主题演讲以及包含 vLLM 的专题讨论。

整个议程中,vLLM 将出现在服务架构与 KV 缓存工作、硬件可移植性、内核与性能优化以及 PyTorch 集成相关环节。其他环节还将涵盖专家混合推理、注意力机制、生产部署、更广泛的应用栈以及开源贡献。

查看完整会议日程

注册参加 2026 年北美 PyTorch 大会

服务架构、KV 缓存与生产推理

#### vLLM 中注意力机制的开发者指南

Lucas Wilkinson,Red Hat;Matthew Bonanni,Red Hat 10 月 20 日 11:45 a.m.–12:10 p.m. | LL20AB | 分论坛

本环节将解释 vLLM 如何表示、服务和优化注意力机制,涵盖模型采用的滑动窗口、稀疏性、压缩、线性变体和混合注意力等方法。

演讲者将介绍注意力后端、KV 缓存连接器和混合内存分配器,并分享 vLLM 注意力抽象层的最新重构内容,包括变更点以及新设计如何更轻松地支持新兴架构。

#### vLLM 中分散式大语言模型服务的前沿 KV 传输技术

Nicolò Lucchesi,Mistral AI;Sunita Nadampalli,Amazon;Zhanqiu Hu,Red Hat 10 月 20 日 2:15–2:40 p.m. | LL20CD | 分论坛

本环节将介绍 vLLM 分散式服务栈在预填充和解码之间传输 KV 缓存的最新进展。主题包括异构张量并行下的混合模型传输、双向 KV 传输、KV Push 连接器以及用于可靠性的 KV 缓存租约。

演讲者报告称,KV Push 能减少首次生成 token 的时间,在 Nemotron 上,分散式预填充/解码在并发级别上帕累托优于本地服务。

#### vLLM 中原生分级 KV 缓存卸载:从存储卸载到分散式服务

Or Ozeri,IBM 10 月 20 日 2:50–3:15 p.m. | LL20CD | 分论坛

本次演讲介绍 vLLM 新增的原生分级 KV 缓存卸载框架,该框架已集成到上游且无外部依赖。

该框架通过 CPU 内存作为通用传输枢纽进行数据路由。设计上最小化 GPU 传输开销,通过 CPU 缓冲区整合 I/O,避免专用传输 API,并在硬件、注意力后端、并行方案和模型架构中保持与 KV 缓存内存布局的独立性。

#### LMCache:面向大语言模型提示缓存的集群级开源解决方案

Kuntai Du,Tensormesh, Inc. 10 月 20 日 3:40–3:50 p.m. | LL20CD | 闪电演讲

LMCache 支持包括 vLLM、SGLang 和 TensorRT-LLM 在内的多个推理引擎,以及包括 Mooncake、Redis 和 AWS S3 在内的多种存储系统。

本环节包含在 Kubernetes 中部署 LMCache 的教程,以及其提示缓存方法背后的技术和研究。

#### vLLM 中面向模型特定需求的 KV 缓存管理

曹梦青,华为 10月20日,下午5:30–5:40 | LL20CD | 灯光演讲

本环节探讨了针对MLA、SWA、Eagle和DeepSeek-V4等不同模型架构的KV缓存需求差异。

提出了一种基于默认规划器加模型专用规划器的定制化KV缓存规划方案,支持特殊分组、块大小推导、缓存张量创建和max_model_len调整等需求。

#### vLLM中的弹性专家并行

Itay Alroy,NVIDIA 10月21日,下午2:50–3:15 | LL20CD | 分论坛

弹性专家并行使vLLM部署能够在运行时动态增减工作节点,并在最小服务中断情况下重新分配专家节点。

环节内容涵盖通信重构、CUDA图重新捕获、通过EP负载均衡器实现专家再平衡、权重向新GPU迁移以及与模型前向执行的协调。还介绍了NIXL EP如何在实时流量下实现扩展和收缩操作,以及故障检测、报告和恢复机制。

#### 多阶段流水线中自回归阶段的前缀缓存

Ricardo Noriega,Red Hat;Alex Brooks,Red Hat 10月21日,下午4:20–4:45 | LL20AB | 分论坛

本次演讲探讨了vLLM-Omni的自动前缀缓存方案,通过该方案可将vLLM的前缀缓存能力扩展至多阶段模型,同时最小化GPU内存消耗。

该方案将外部CPU张量缓存与vLLM原生的块管理机制对齐。演讲者还介绍了vLLM-Omni如何动态发现可缓存张量,无需手动配置。

硬件可移植性与加速器后端

#### 赞助:使用TorchTPU在Google Cloud TPUs上统一开源LLM服务

Rob Mulla,Google 10月20日,上午10:40–10:50 | 社区博览会 | 演示剧场

这个10分钟演示展示了TorchTPU在Cloud TPUs上对PyTorch模型的原生高性能编译路径。

演示重点突出TorchTPU作为统一后端,支持包括vLLM和SGLang在内的推理引擎,通过这些服务引擎部署模型只需极少的代码修改。

#### 赞助:PyTorch生态系统原生运行在Trainium上

Maen Suleiman,Amazon Web Services 10月20日,上午10:55–11:05 | 社区博览会 | 演示剧场

该实时演示通过TorchNeuron展示Trainium上的PyTorch工作流,包括使用TorchTitan或Hugging Face Transformers v5进行训练、使用vLLM-Neuron进行服务、使用Neuron Explorer进行性能分析,以及直接将NKI内核添加到PyTorch代码中。

环节还演示了Neuron Agentic Development——一种用于内核编写和优化的人工智能辅助工具链。

#### 一个模型定义,多种加速器:在不分支的情况下扩展vLLM至不同硬件

Thomas Parnell,IBM;Richard Zou,Meta 10月20日,下午4:20–4:45 | LL20CD | 分论坛

本次演讲介绍了vLLM的硬件无关模型定义方法,通过将模型逻辑与硬件执行路径分离,使相同模型定义可在不同加速器上运行,无需分支或平台特定维护。

该设计依赖于与torch.compile的兼容性、明确定义的可扩展钩子以及与硬件特定路径的隔离。演讲者展示了该方法如何支持Intel Gaudi/HPU和IBM Spyre,而无需特定硬件的建模代码。

#### 跨AI加速器的可移植PyTorch:从Eager模式到vLLM的Triton操作符栈

林永华,北京人工智能研究院 10月20日,下午4:55–5:20 | LL20CD | 专题讨论会

本环节介绍FlagOS,这是一个基于Triton的操作符、编译器和运行时层的开源系统栈,用于PyTorch。

FlagGems在Triton中实现了PyTorch即时模式操作符和LLM关键内核,同时相同的操作符层通过vllm-plugin-fl多后端插件连接到vLLM。

演讲者报告称已在20多种AI芯片和架构上测试FlagOS,并表示已实现包括Qwen3.5、MiniMax-M3、MiniCPM-5和DeepSeek-V4在内的模型的Day-0适配。他们报告称相比原始厂商适配,推理性能提升了5–40%。

#### 使用vLLM和OpenVINO在Arm上高效执行MoE LLM推理

Abhishek Jain,印度富士通研究所;N Maajid Khan,印度富士通研究所 10月20日,下午4:55–5:05 | LL21ABC | 闪电演讲

本次演讲介绍针对Arm CPU优化的vLLM和OpenVINO推理栈,包含SVE优化的SDPA和Paged Attention、U8 KV-cache量化、操作符融合、KleidiAI集成以及针对8位和4位推理的优化线程。

针对专家混合模型,演讲者介绍了NUMA感知的GatherMatMul操作符,该操作符将动态令牌和专家选择与矩阵乘法相结合。在AWS Graviton3e上的基准测试显示,GPTOSS/Llama模型的吞吐量提高约2倍。

#### 集成IBM Spyre加速器

David Grove,IBM;Antoni Viros i Martin,IBM研究院;Avery Blanchard,IBM研究院 10月20日,下午4:55–5:20 | LL21DEF | 专题讨论会

Torch-Spyre是一个开源项目,为IBM Spyre加速器提供带有OpenReg的PyTorch PrivateUse1设备,包含Inductor后端。

演讲者报告称,通过PyTorch集成,IBM Spyre加速器现在可以运行来自Hugging Face和vLLM的数千个模型。本环节涵盖Torch-Spyre的现状、2026年实现的功能增强和性能改进、对PyTorch的贡献、特定设备的张量布局以及针对缓存区的优化分块。

#### 主题演讲:代理时代的工作负载可移植性

Bill Jia,Google Cloud 10月21日,上午9:15–9:25 | 大宴会厅 | 主题演讲

本次主题演讲使用TorchTPU展示PyTorch工作流在模型开发、训练和部署中的应用,包括通过vLLM和SGLang进行部署。

本环节还演示了通过代理工作流将模型工作负载从GPU迁移到TPU的方法,并探讨其在量化、自定义内核生成和分片策略等性能优化任务中的应用。

#### 在TPU上原生运行的PyTorch LLM服务:SGLang和vLLM

Colin Taylor,Meta;Qi Zhou,Google;Angela Yi,Meta 10月21日,下午2:15–2:40 | LL20CD | 专题讨论会

本环节介绍SGLang和vLLM通过新的PyTorch原生TPU后端在TPU上运行,同时保留服务引擎的调度器、批处理系统、OpenAI兼容API和torch.compile工作流。

演讲者涵盖torch.compile到TPU的转换、Pallas注意力机制、张量和专家并行性、专家混合执行、用于大型MoE模型(包括Qwen3-Coder-480B)的FP8、多模态编码器、预填充/解码分离以及推测解码。演讲者表示,这两个平台将在演讲时开源。

内核与性能优化

#### 使用CUTLASS Python进行高速GPU内核开发

Michael Goldfarb, NVIDIA; Guray Ozen, NVIDIA 10月20日 12:20–12:45 p.m. | 210BF | 分论坛

本次演讲介绍了 CUTLASS CuTe DSL 的新特性,该领域特定语言(DSL)以 Python 为优先,演讲者报告称其已在 FlashAttention 4、TRT-LLM、vLLM 和 FlashInfer 等项目中实现了高性能 GPU 内核。

本节内容涵盖 CuTe DSL 扩展功能、CUTLASS Python 原语(用于直接访问底层硬件指令)以及资源与任务调度器——一个用于异步原语静态验证的零成本元编程框架。

#### 通过 fastsafetensors 加速大语言模型服务启动

Takeshi Yoshimura, IBM 10月20日 3:25–3:35 p.m. | LL20CD | 闪电演讲

本次演讲介绍 fastsafetensors,这是一个用于加速 PyTorch 推理系统(包括 vLLM)中 safetensors 检查点加载的开源库。

fastsafetensors 通过消除每个张量的复制操作、合并碎片化 I/O 操作并跳过主机中转阶段实现加速。演讲者报告称模型加载速度提升达 4.8 倍至 7.5 倍,NVMe 读取吞吐量最高可达 28 GB/s。

本节内容还涵盖并行加载、3FS 集成、ROCm 支持、包含运行时 CUDA/ROCm 检测的通用 wheel 包、Windows DirectStorage 探索以及统一内存支持等贡献。

#### 赞助环节:量化竞赛:PyTorch 推理优化

Markell Rawls, Red Hat 10月20日 4:10–4:20 p.m. | 社区博览会 | 演示剧场

本次实时演示将探讨使用 LLM Compressor 和 vLLM 等工具进行量化和推测解码的技术。

本节内容通过压力测试验证这些技术在负载下的性能、成本和质量权衡,分析其在生产部署中的实际表现。

#### 从数周到一夜:基于代理流水线的自主 Day-0 内核启动

Xiaogang Gu, Intel; Qun Yang, Intel 10月20日 5:30–5:40 p.m. | 210BF | 闪电演讲

本节介绍一种基于流水线的自主系统,用于 GPU 内核优化。该系统包含专门代理,负责在隔离环境中处理性能分析、代码生成、验证、修复、基准测试和评估等任务。

通过真实 vLLM 推理工作负载验证,演讲者报告称将内核启动和优化周期从数周缩短至无人值守的一夜完成。

#### 在 Intel GPU 上使用 Triton 内核加速 vLLM

Whitney Tsang, Intel; Artur Fierka, Intel 10月21日 12:20–12:30 p.m. | 210BF | 闪电演讲

本次演讲探讨在 Intel GPU 上用于 vLLM 的 Triton 内核,并分析 Triton 在推理工作负载上如何超越 SYCL 的性能。

演讲重点包括统一注意力机制、融合 MoE、批量 MoE、自动调优、以张量描述符为导向的内核结构以及融合机会。同时讨论这些选择如何提升端到端 vLLM 的吞吐量和延迟,以及 SYCL 在哪些场景仍具竞争力。

#### HiFloat:在 PyTorch 生态系统中普及超低精度训练和推理

Yun Zhao, 华为; Haonan Zhang, 华为 10月21日 2:50–3:00 p.m. | LL20AB | 闪电演讲

本节介绍 HiFloat8 和 HiFloat4,并演示 DeepSpeed 和 vLLM 中基于 HiFloat 加速的 LLM 工作流。

实现方案采用 PyTorch 自定义操作、基于 Triton 的内核以及 torch.compile。在展示的基准测试中,演讲者报告称 HiF8 在保持 FP16 最终损失一致性的前提下,实现了 1.5 到 1.7 倍的 GEMM 加速。

#### 可移植分页注意力:从 Triton 到 Helion

Burkhard Ringlein, IBM 研究院 10月21日 3:25–3:50 p.m. | 210BF | 分论坛

This session compares Triton and Helion implementations of Paged Attention and presents an experimental Helion attention backend for vLLM.

The speaker covers differences between the two implementations, algorithm changes needed to achieve matching performance, and optimizations enabled by Helion. Early results indicate that the experimental Helion backend can reduce latency by up to 50% and improve end-to-end throughput versus Triton by up to 10%.

PyTorch Integration and Compatibility

#### Shipping PyTorch and Its Ecosystem: A Modern Release Story

Andrey Talman, Meta October 20, 11:45–11:55 a.m. | LL21DEF | Lightning Talk

This talk covers changes to PyTorch release engineering, including continuous validation of Triton and vLLM against PyTorch nightlies so ecosystem breakage can surface upstream before the release branch is cut.

The session also covers a faster, more predictable release process and the use of AI agents to triage CI, separate noise from regressions, and draft fixes, while leaving final decisions with people.

#### Sponsored: Making Enterprise Agentic Inference Production-Ready with PyTorch and vLLM

Joseph Groenenboom, Red Hat; Tyler Michael Smith, Red Hat October 20, 3:25–3:50 p.m. | LL21ABC | Sponsored Session

This session examines reliability, observability, KV cache management, and concurrency requirements for enterprise inference systems.

The speakers cover a sample of upstream work across PyTorch, vLLM, other Foundation projects, and the broader ecosystem, from core PyTorch build infrastructure to model-serving improvements for tool calling and long-context, multi-turn chat.

#### Clearing the Path Towards an ABI Stable PyTorch C++ Extension Ecosystem

Sean McGovern, Red Hat; Chris Leonard, Red Hat; Jane Xu, Meta October 21, 2:15–2:40 p.m. | LL21ABC | Breakout Session

PyTorch’s stable ABI provides a binary-compatible C interface that extensions can target across PyTorch versions without recompilation.

This session presents tools for identifying and inventorying unstable API usage and applying source-to-source conversion with LLM-assisted follow-up. The speakers demonstrate the process on libraries including vLLM and SGLang.

#### From Backed to Unbacked: Sound, Predictable, and Controllable Dynamic Shapes in PyTorch

Laith Sakka, Meta October 21, 4:20–4:45 p.m. | LL21ABC | Breakout Session

This talk covers unbacked dynamic shapes for explicit graph-capture workflows including vLLM, export, and pre-compilation, as well as JIT deployments where dynamic-shape recompilation is not acceptable.

The session covers data-dependent errors and branching, work to close the performance gap with backed shapes across TorchBench and vLLM, and APIs for shape constraints and dispatch across compiled artifacts.

vLLM in Broader Applications and Infrastructure

#### Understanding Modern Vision Language Models

Aastha Jhunjhunwala, NVIDIA; Mark Moyou, NVIDIA October 20, 12:20–12:45 p.m. | LL20AB | Breakout Session

This session deconstructs five open source vision-language model architectures, covering image tokenization, vision-language fusion, differences between training and inference, fine-tuning, and multi-GPU training.

For production serving, the speakers cover image-token growth, KV-cache pressure, throughput, and where tools including vLLM fit.

#### Sponsored: Hardware-Aware AI: Building Agentic Systems from Cloud to Edge with PyTorch, ExecuTorch

Kavya Sri Chennoju, Arm 10月20日 12:20–12:45 p.m. | LL20CD | 赞助环节

本环节展示了一个从云到边缘的完整工作流程,结合PyTorch进行模型开发、ExecuTorch实现设备端推理、vLLM支持可扩展的LLM服务,以及Arm Device Connect与异构硬件进行交互。

实时演示展示了基础模型对任务进行推理,调用边缘模型,获取实时传感器数据,并通过统一编程模型协调物理设备。

#### 保持GPU高利用率:通过fsspec实现PyTorch的高速存储

Ankita Luthra, Google; Trinadh Kotturu, Google 10月20日 3:40–3:50 p.m. | LL21DEF | 简短演讲

本演讲介绍了Rapid Storage方案,该方案通过fsspec将Google Colossus状态协议引入PyTorch,并利用持久化gRPC流与存储层通信。

演讲者报告称随机读写延迟低于1毫秒,数据访问速度提升20倍,聚合吞吐量达到6TB/s,随机I/O尾部延迟降低至原来的1/10。该集成方案通过gcsfs和更广泛的fsspec生态系统实现,包括与vLLM及其他数据和AI框架的兼容。

#### 赞助环节:从提示到物理动作:PyTorch与ExecuTorch的实时硬件感知AI演示

Kavya Sri Chennoju, Arm 10月20日 3:55–4:05 p.m. | 社区博览会 | 演示剧场

该实时演示将PyTorch、ExecuTorch、vLLM和Arm Device Connect整合到一个跨云、边缘和嵌入式设备的工作流程中。

从自然语言请求开始,大型语言模型对任务进行推理,发现可用设备,调用边缘AI模型,获取实时传感器数据,并通过统一编程模型协调硬件。

#### 从PyTorch到生产:使用ONNX、Ray和vLLM部署物理约束生成模型

Arun Sharma, 明尼苏达大学 10月21日 2:50–3:15 p.m. | 210AE | 分组讨论

本环节追踪一个物理约束生成降尺度模型从PyTorch训练到服务部署的全过程。

演讲内容涵盖通过torch.onnx和AOTInductor导出模型、校正流采样、推理阶段的物理约束,以及用于扩展的Ray Train方案。服务路径整合了Rust中的ONNX运行时、Go中的Temporal,以及一个将降尺度器作为工具调用的vLLM代理。

vLLM社区与贡献

#### 贡献给持续演进的推理开源项目:关于vLLM、llm-d和动态目标的BoF讨论

Maroon Ayoub, Red Hat; Nili Guy, IBM 10月21日 10:35–11:05 a.m. | 社区博览会 | 鸢尾花讨论

本次鸢尾花讨论聚焦于为快速发展的推理项目(包括vLLM和llm-d)做贡献。

贡献者、维护者和潜在贡献者将比较提交首个Pull Request的实践方法、贡献者招募策略、跨项目技术决策跟踪方式,以及参与跨公司开源开发的实践经验。

探索完整议程

这些环节既包含直接聚焦vLLM的专题演讲,也包含更广泛的讨论,涵盖vLLM作为服务栈组件、实现方案、硬件集成、优化工作或应用工作流的多个方面。

/post-content

/inner-wrap