Towards Free Normalization: Fusing Normalization into GEMM and Attention Kernels
PyTorch Blog5871 字 (约 24 分钟)
85
PyTorch通过融合归一化操作到GEMM和注意力内核,实现高达35%的性能提升,减少内存IO开销。
入选理由:Lazy Pre-Norm和Multi-CTA Norm Fusion技术可隐藏90%的归一化延迟
精选文章#PyTorch#深度学习优化#归一化#GEMM#注意力机制英文
