月之暗面在GTC 2026披露Kimi K2.5技术路线:用MuonClip、线性注意力与Agent Swarm重构三大基础组件
TL;DR · AI 摘要
月之暗面在GTC 2026披露Kimi K2.5技术路线:用MuonClip、线性注意力与Agent Swarm重构三大 · AI HOT 宝玉 @ dotey · X 精选 81 导出 Markdown 2026-07-18 01:38...
核心要点
- 主题聚焦:月之暗面在GTC 2026披露Kimi K2.5技术路线:用MuonClip、线性注意力与Age
- 来源:AI HOT 精选,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
月之暗面在GTC 2026披露Kimi K2.5技术路线:用MuonClip、线性注意力与Agent Swarm重构三大 · AI HOT
宝玉
@
dotey
· X
精选
81
导出 Markdown
2026-07-18 01:38
·
9小时前
在 X 看原推
x.com
精选理由
月之暗面把 Adam、全注意力和残差连接三大基础组件全换了,而且全部开源。这不是小修小补,是训练范式的替代路线,做模型训练的人应该仔细看看。
AI 摘要
月之暗面CEO杨植麟在GTC 2026演讲中提出用MuonClip优化器替代Adam,可将数据利用效率提升近一倍。同时推出Kimi Linear线性注意力,在百万Token上下文下全面超越全注意力;Agent Swarm已支持300个Agent并行工作。
杨植麟在 GTC 2026 的一次演讲"How We Scaled Kimi K2.5":月之暗面想把 AI 训练中三个沿用了近十年的基础组件,重新做一遍。优化器 Adam(2014 年)、注意力机制(2017 年)、残差连接(2015 年),三个 Transformer 时代的地基组件,月之暗面各给了一个替代方案,而且全部开源。
但这场演讲讲的不只是 K2.5,而是月之暗面过去一年多的技术路线:开源模型还能从哪里继续变强,又该怎样逼近闭源模型的前沿水平。
杨植麟把答案拆成了三个方向:让每个 Token 更值钱、让更长的上下文真正发挥作用,以及让多个 Agent 同时协作。
此外,他还分享了两个重要进展:视觉训练如何反过来增强文本能力,以及月之暗面刚刚公布的下一代架构 Attention Residue。
【一、数据不够,就让每个 Token 更值钱】
大模型训练正在遇到一个越来越现实的问题:高质量数据快不够用了。