PyTorch 2.14 Release Blog
PyTorch 2.14 引入 NVGEMM 性能优化、Apple Silicon 原生线性代数支持及分布式容错机制,显著提升大规模训练和推理效率。
入选理由:NVGEMM 技术使 CUTLASS 内核融合效率提升 30% 以上
产品
用于 GPU 内存优化的编译器框架
已跟踪 8 条高相关材料
最近变化
2026-09-04 · Trainium实现PyTorch原生支持无需代码修改
为什么值得关注
Triton 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Your Guide to Hardware Acceleration & Compute Infrastructure at PyTorch Conference North America 2026
PyTorch Blog · 8.5 分
PyTorch 2026北美会议聚焦硬件加速与计算基础设施,涵盖TPU、Trainium等新硬件及TorchInductor等工具的深度优化。
PyTorch 2.14 Release Blog
PyTorch Blog · 8.5 分
PyTorch 2.14 引入 NVGEMM 性能优化、Apple Silicon 原生线性代数支持及分布式容错机制,显著提升大规模训练和推理效率。
FP8 Training on AMD GPUs with TorchTitan and TorchAO: Upstreaming Performance Improvements
PyTorch Blog · 8.5 分
PyTorch Blog文章展示了在AMD GPU上使用FP8训练的性能提升,包括13.4%吞吐量增益和6.2倍加速,通过Triton融合等技术实现。
已收录 8 条与 Triton 相关的内容,按评分排序。
PyTorch 2.14 引入 NVGEMM 性能优化、Apple Silicon 原生线性代数支持及分布式容错机制,显著提升大规模训练和推理效率。
入选理由:NVGEMM 技术使 CUTLASS 内核融合效率提升 30% 以上
PyTorch 2026北美会议聚焦硬件加速与计算基础设施,涵盖TPU、Trainium等新硬件及TorchInductor等工具的深度优化。
入选理由:Trainium实现PyTorch原生支持无需代码修改
PyTorch Blog文章展示了在AMD GPU上使用FP8训练的性能提升,包括13.4%吞吐量增益和6.2倍加速,通过Triton融合等技术实现。
入选理由:FP8训练在Llama3-8B模型上实现13.4%吞吐量提升,内存占用与BF16接近。
Meta通过fbtriton基础设施实现与上游Triton的同步,结合分层验证框架管理GPU优化创新,解决代码冲突与验证难题。
入选理由:使用agentic ingestion机制实现上游代码自动分类合并,降低冲突风险。
GPT 5.6通过递归自我优化使推理成本下降13倍,价格降幅达20%-80%,并引入2.5倍加速模式。
入选理由:GPT-5.6 Sol通过自主内核优化降低20%端到端成本
PyTorch 3.7引入Triton Plugin Extensions,支持动态加载自定义编译器传递,无需分叉Triton,性能匹配厂商库。
入选理由:Triton Plugin Extensions允许动态加载自定义编译器传递,无需分叉或重新编译。
多智能体协作显著提升了 Gemma 4 的推理速度,达到 5 倍提升,并展现出自我监管和协作机制。
入选理由:100+ 智能体协作使 Gemma 4 推理速度提升 5 倍。
国产GPU厂商摩尔线程通过开源活动吸引多个大模型推理框架核心开发者。
入选理由:SGLang在12个H100节点上实现52.3k输入token/s/node性能