Towards Free Normalization: Fusing Normalization into GEMM and Attention Kernels
PyTorch通过融合归一化操作到GEMM和注意力内核,实现高达35%的性能提升,减少内存IO开销。
入选理由:Lazy Pre-Norm和Multi-CTA Norm Fusion技术可隐藏90%的归一化延迟
产品
别名:triton language extensions
基于Triton的低级硬件感知DSL,用于GPU执行控制。
已跟踪 2 条高相关材料
最近变化
2026-07-15 · Triton Plugin Extensions允许动态加载自定义编译器传递,无需分叉或重新编译。
为什么值得关注
TLX 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Triton Plugin Extensions: Enabling TLX and Custom Compiler Passes Out of the Box
PyTorch Blog · 8.5 分
PyTorch 3.7引入Triton Plugin Extensions,支持动态加载自定义编译器传递,无需分叉Triton,性能匹配厂商库。
Towards Free Normalization: Fusing Normalization into GEMM and Attention Kernels
PyTorch Blog · 8.5 分
PyTorch通过融合归一化操作到GEMM和注意力内核,实现高达35%的性能提升,减少内存IO开销。
已收录 2 条与 TLX 相关的内容,按评分排序。
PyTorch通过融合归一化操作到GEMM和注意力内核,实现高达35%的性能提升,减少内存IO开销。
入选理由:Lazy Pre-Norm和Multi-CTA Norm Fusion技术可隐藏90%的归一化延迟
PyTorch 3.7引入Triton Plugin Extensions,支持动态加载自定义编译器传递,无需分叉Triton,性能匹配厂商库。
入选理由:Triton Plugin Extensions允许动态加载自定义编译器传递,无需分叉或重新编译。