简单谈谈K3的MoE和Attention
科学空间3451 字 (约 14 分钟)
85
K3模型通过Stable LatentMoE和SiTU-GLU改进MoE稳定性,结合Per-Head Muon优化Attention机制,实现效果与效率的平衡。
入选理由:K3采用SiTU-GLU替代SwiGLU,通过softcap操作减少梯度爆炸风险
FeaturedArticle#MoE#Attention#K3模型#深度学习#模型优化中文
模型
独立计算每个Attention头权重的优化器
已跟踪 1 条高相关材料
最近变化
2026-08-04 · K3采用SiTU-GLU替代SwiGLU,通过softcap操作减少梯度爆炸风险
为什么值得关注
Per-Head Muon 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
已收录 1 条与 Per-Head Muon 相关的内容,按评分排序。
K3模型通过Stable LatentMoE和SiTU-GLU改进MoE稳定性,结合Per-Head Muon优化Attention机制,实现效果与效率的平衡。
入选理由:K3采用SiTU-GLU替代SwiGLU,通过softcap操作减少梯度爆炸风险