T
traeai
登录

产品

Triton

用于 GPU 内存优化的编译器框架

已跟踪 8 条高相关材料

TraeAI 观察

相关材料

已收录 8 条与 Triton 相关的内容,按评分排序。

PyTorch 2.14 Release Blog

PyTorch 2.14 Release Blog

PyTorch Blog8497 字 (约 34 分钟)
85

PyTorch 2.14 引入 NVGEMM 性能优化、Apple Silicon 原生线性代数支持及分布式容错机制,显著提升大规模训练和推理效率。

入选理由:NVGEMM 技术使 CUTLASS 内核融合效率提升 30% 以上

精选文章#PyTorch#深度学习#AI框架#分布式计算#硬件支持英文
FP8 Training on AMD GPUs with TorchTitan and TorchAO: Upstreaming Performance Improvements

PyTorch Blog文章展示了在AMD GPU上使用FP8训练的性能提升,包括13.4%吞吐量增益和6.2倍加速,通过Triton融合等技术实现。

入选理由:FP8训练在Llama3-8B模型上实现13.4%吞吐量提升,内存占用与BF16接近。

精选文章#FP8#TorchTitan#AMD GPU#Triton#MoE英文
FBTriton Infra: Upstream Ingestion, Hierarchical Validation, Ideals vs Realities

Meta通过fbtriton基础设施实现与上游Triton的同步,结合分层验证框架管理GPU优化创新,解决代码冲突与验证难题。

入选理由:使用agentic ingestion机制实现上游代码自动分类合并,降低冲突风险。

精选文章#Triton#GPU优化#代码同步#验证框架中英混合
Triton Plugin Extensions: Enabling TLX and Custom Compiler Passes Out of the Box

PyTorch 3.7引入Triton Plugin Extensions,支持动态加载自定义编译器传递,无需分叉Triton,性能匹配厂商库。

入选理由:Triton Plugin Extensions允许动态加载自定义编译器传递,无需分叉或重新编译。

精选文章#PyTorch#Triton#编译器优化#GPU内核英文
国产GPU组了个开源局,把SGLang等核心开发者都摇来了!

国产GPU组了个开源局,把SGLang等核心开发者都摇来了!

量子位3400 字 (约 14 分钟)
85

国产GPU厂商摩尔线程通过开源活动吸引多个大模型推理框架核心开发者。

入选理由:SGLang在12个H100节点上实现52.3k输入token/s/node性能

精选文章#GPU#开源生态#大模型推理中文

跨材料问答 · Triton

回答基于:Triton 相关 8 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容