AWS Trainium Frontier competition: Co-design models and kernels on purpose-built AI chips
TL;DR · AI 摘要
AWS推出Trainium Frontier竞赛,挑战研究者在专用AI芯片上设计最优模型架构,探索硬件变化对模型设计的影响。
核心要点
- 竞赛分两阶段:30分钟单芯片优化与4小时服务器训练,考核模型训练与推理性能。
- 前三名奖金总计$40,000,优胜者可与Annapurna Labs联合发表论文。
- Trainium芯片的高SRAM和能效比可能使模型设计从内存瓶颈转向计算瓶颈。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Trainium Frontier竞赛
- 竞赛目标
- 探索硬件变化对模型架构的影响
- 硬件特性
- 高SRAM容量
- 能效比优化
- 显式数据控制
- 竞赛阶段
- Phase 1: 单芯片优化
- Phase 2: 服务器训练
金句 / Highlights
值得收藏与分享的关键句。
Trainium芯片的TFLOPs-to-memory-bandwidth比使内存瓶颈操作可能变为计算瓶颈。
竞赛优胜者将与Annapurna Labs研究人员联合发表论文。
Phase 2中前10名团队将进行4小时服务器训练并评估推理性能。
AWS Trainium Frontier竞赛:在专用AI芯片上协同设计模型和内核 - Amazon Science
机器学习
AWS Trainium Frontier竞赛:在专用AI芯片上协同设计模型和内核
一场在NeurIPS 2026期间设有决赛典礼的竞赛,挑战研究人员在Trainium芯片上从零开始训练语言模型,探索当硬件发生变化时最优架构的形态。
作者
Louise Ping
John Gray
Emily Webber
Josh Longenecker
2026年8月10日
7分钟阅读
分享
- 复制链接
- 邮件
- X
- 领英
- Line
- QZone
- 新浪微博
- 微信
分享到微信
x
关键要点
- AWS Trainium Frontier竞赛挑战研究人员在专用AI芯片上从零开始训练语言模型,探索当硬件约束与传统加速器发生根本性变化时,最优模型架构的差异。
- 该竞赛包含两个阶段:第一阶段(在单个Trainium2芯片上优化每字节验证位数,限时30分钟)和第二阶段(前10支队伍在完整服务器上进行4小时训练,增加上下文学习任务的推理性能评分)。
- 获胜者将在2026年悉尼NeurIPS会议上获得表彰,有机会与Annapurna Labs研究人员联合发表论文,并获得奖金(第一名25,000美元,第二名10,000美元,第三名5,000美元),前10名队伍还将获得专属礼品和夹克。
这个回答有帮助吗?
现代大型语言模型架构在单一硬件体系内共同发展。我们的注意力机制形态、多层感知机(MLP)结构、数值格式选择,甚至并行策略的粒度,都受到硬件约束的影响:线程块大小、张量核心几何结构、内存层次以及芯片暴露的内核抽象。当硬件发生变化时,模型架构的效率边界也会随之改变。在这里,我们为学术和工业实验室提供了一个机会,可以在AWS Trainium上详细探索这一边界。
像AWS Trainium这样的专用加速器呈现出真正不同的设计界面。片上SRAM(SBUF)容量更大,软件对数据移动和底层加速具有显式控制能力,能效更高的系综矩阵乘法(matmuls),以及专为训练和推理规模数据流设计的内存层次结构。由此产生的每TFLOP内存带宽比改变了性能瓶颈特征:在传统加速器上受内存限制的关键操作,在Trainium上可能变为计算限制,从而为通过增加计算量换取减少内存流量的架构设计开辟了空间。这些硬件差异意味着最优的注意力模式、MLP结构和并行策略可能从根本上不同。
研究问题仍然开放:当硬件约束从根本上不同时,最优模型应该是什么样子?AWS Trainium Frontier 是一项旨在通过实证回答这一问题的竞赛:参赛者需要在 Trainium 上从零开始训练语言模型,探索从模型架构到自定义内核的完整设计空间。核心任务是从提供的约 5000 万参数基线(基于 nanochat 的 GPT 风格密集型 LLM,包含 RMSNorm、旋转嵌入和 ReLU² MLP)开始,从零训练语言模型。参赛者可以修改所有内容:架构、优化器、训练循环,以及可选的 NKI 自定义内核。该基线只是一个起点,而非上限。
AWS Trainium Frontier 竞赛在固定时间和计算预算下奖励全栈思维。参赛者需要优化模型架构、优化器、训练循环,以及(如果选择)自定义硬件内核。这使得可以在多个目标上实现创新:在给定的训练预算内,验证位每字节(bits-per-byte)能降低到多低?下游上下文学习能力又能提升到多高?固定的预算在模型容量(更优架构 = 更少训练步数)和训练吞吐量(更快内核 = 相同时间内更多训练步数)之间形成了直接权衡。获胜方案将找到平衡点:在时间限制内训练出最高效且最智能的模型。
最终提交方案将在该前沿上找到最优解,而由于 Trainium 的硬件特性与现有加速器存在差异,最优架构也将随之不同。成为首批发现专为 AI 芯片设计的模型架构的人,为机器学习研究开辟真正的新领域。
Neuron 内核接口(NKI)、原生 PyTorch 支持以及 AI 辅助工具(包括 Amazon Bedrock 接入)让您能够直接访问 Trainium 独有的硬件特性:SBUF 刮板区、TensorEngine 分块机制以及标准框架抽象无法暴露的显式 DMA 控制。这正是实现真正硬件原生模型设计的关键。整个 NKI API 接口可以在周末内掌握,无论是人工编写内核还是 AI 代理在人工指导下生成内核,都同样易于使用。
挑战:探索完整设计空间
第一阶段为每个团队提供一块 Trainium2 芯片和 30 分钟的训练预算,足够在一天内测试数十个假设。第一阶段的评分基于单一指标:在单块 Trn2 芯片上经过 30 分钟训练后的验证位每字节(val_bpb)。数值越低越好。只要在时钟预算内实现任何改进,无论是来自架构、优化器、内核还是三者结合,都将被计入评分。第二阶段将排名前十的团队晋级至完整的 Trainium2 服务器,配备四小时预算,开启分布式并行和通信感知模型设计的可能性。第二阶段新增了第二个维度——在 CORE 上的推理性能,这是一个涵盖推理、理解与世界知识的上下文学习任务的综合评分。您的最终得分是 50/50 的复合指标:您需要一个既能高效训练又能学习推理的模型。这是一个从“我的想法是否可行?”到“我的想法是否可扩展?”的研究弧线。
参与者在改进模型方面拥有灵活性。一个更优的学习率调度方案与更快的内核同样重要。这奖励了完整的堆栈能力:一种新颖的注意力机制的运行速度取决于执行它的内核,而最快的内核只有在架构知道如何使用时才有意义。模型规模没有上限:限制因素不是参数数量,而是芯片上的时间。
您需要选择在固定训练窗口内最大化能力的模型架构。这种对传统扩展范式的倒置使得这个问题更具挑战性,而不仅仅是工程实践,这也是最具可发表性的洞察将出现的地方。
您将获得
- 完整的基于 nanochat 的训练流水线,包含 Muon + AdamW 优化器,可直接在所有 NeuronCores 上运行
- 专为 Trainium 优化的自动研究框架,用于 AI 辅助实验
- 完整的 NKI 文档:编程指南、ISA 参考、架构文档和示例内核
- Neuron Explorer 工具,用于对 NKI 内核进行全面性能分析和调试
- 用于第 2 阶段推理自评分的 CORE 评估套件
- 符合条件的学术团队可获得 AWS 促销积分,涵盖 Trainium 计算和 Amazon Bedrock 访问权限
- 无需额外安装包即可在 Neuron 上原生使用 PyTorch
适合参赛者
- 探索模型设计、优化器和训练方案的机器学习架构与训练研究员。预计需要熟悉 PyTorch 和 transformer 训练;在机器学习层面无需硬件内核经验即可具备竞争力。
- 关注硬件感知优化、自定义内核以及模型设计与硬件之间协同关系的机器学习系统研究员和性能工程师。熟悉 CUDA、Triton 或类似内核编程经验可直接迁移至 NKI;无需 Trainium 先验经验。
- 使用 AI 研究代理构建团队,通过大语言模型和自动化技术运行更多实验、编写更多内核、探索更多架构,这是任何个人都无法企及的。该竞赛奖励探索广度,使代理式方法成为天然契合的选择。
- 欢迎由 1 至 4 人组成的团队参赛。优秀的提交作品很可能结合多个视角,无论是单个团队内部,还是通过 AI 辅助工作流扩展团队在技术栈中的覆盖范围。
奖励内容
- 三名决赛选手将在 2026 年悉尼 NeurIPS 期间的 Annapurna Labs 研究活动上展示成果,与机器学习社区和 AWS AI 芯片领导层分享发现。差旅和费用由决赛选手自行承担。
- 前 10 名团队成员将获得专属 Neuron 团队夹克和决赛纪念礼包。
- 三名决赛选手有机会与 Annapurna Labs 研究员联合发表成果,为硬件原生模型设计的开创性论文做出贡献。
- 奖金池:第一名 25,000 美元,第二名 10,000 美元,第三名 5,000 美元。
关键日期
- 2026 年 8 月 31 日:第 1 阶段开启;排行榜上线
- 2026 年 9 月 30 日:第 1 阶段关闭;前 10 名公布
- 2026 年 10 月 7 日:前 10 名进入第 2 阶段,使用完整 Trn2 服务器
- 2026 年 11 月 4 日:第 2 阶段关闭
- 2026 年 11 月 11 日:决赛选手遴选
- 2026 年 12 月 6–12 日:决赛展示在悉尼竞赛工作坊举行
请于 2026 年 9 月 30 日前注册。其他资格限制适用。详见条款和条件。
竞赛向前100支注册队伍开放。参与者须年满18岁。AWS员工、实习生、学者(2025–2026年)及其直系亲属不具备参赛资格。某些国家的居民被排除在外;详情请参阅完整的竞赛条款。队伍规模可为1至4人。立即注册以确保您的队伍席位,开始在真正的新芯片上构建。前沿领域已向您敞开——来探索另一侧的奥秘。
研究领域
- 机器学习
标签
- 芯片设计
- NeurIPS
- 硬件
关于作者
Louise Ping 是 Annapurna Labs 的 AWS Trainium 团队资深市场推广专家。
John Gray 是 Annapurna Labs 的 AWS Trainium 团队资深解决方案架构师。
Emily Webber 是 Annapurna Labs 的 AWS Trainium 团队首席机器学习专家解决方案架构师。
Josh Longenecker 是 Annapurna Labs 的 AWS Trainium 团队解决方案架构师。