向阳乔木(@vista8)
一直好奇,为啥最近大模型参数都能上 T,且质量超好? 感觉跟新模型构架有关系。 从一篇文章发现个叫 Gated Delta Networks 的东西,建立在Mamba思想上。 无论英伟达的Nem...
8.5内容质量

TL;DR · AI 摘要
大模型参数规模突破T级得益于新型架构如Gated Delta Networks和Mamba的创新,英伟达、Kimi、Qwen等均采用混合架构优化性能。
核心要点
- Gated Delta Networks基于Mamba思想,提升模型效率。
- 英伟达Nemotron和Qwen采用混合架构优化性能。
- Kimi Delta Attention通过动态注意力机制增强质量。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 大模型架构创新
- Gated Delta Networks
- Mamba思想
- 混合架构案例
- 英伟达Nemotron
- Qwen
- Kimi Delta Attention
金句 / Highlights
值得收藏与分享的关键句。
Gated Delta Networks建立在Mamba思想上,成为大模型架构创新的关键。
英伟达Nemotron与Qwen均采用混合架构,验证该设计的行业影响力。
Kimi Delta Attention通过动态注意力机制,提升长序列处理能力。
#大模型#Mamba#Gated Delta Networks#英伟达#Qwen
打开原文向阳乔木 on X: "一直好奇,为啥最近大模型参数都能上 T,且质量超好? 感觉跟新模型构架有关系。 从一篇文章发现个叫 Gated Delta Networks 的东西,建立在Mamba思想上。 无论英伟达的Nemotron 模型、还是Kimi的Kimi Delta Attention,Qwen 的最新模型构架。 都是类似混合构架,有必要今天好好学习下这篇论文。 https://t.co/1wAFggD9Pz" / X
向阳乔木
@vista8
一直好奇,为啥最近大模型参数都能上 T,且质量超好? 感觉跟新模型构架有关系。 从一篇文章发现个叫 Gated Delta Networks 的东西,建立在Mamba思想上。 无论英伟达的Nemotron 模型、还是Kimi的Kimi Delta Attention,Qwen 的最新模型构架。 都是类似混合构架,有必要今天好好学习下这篇论文。
4:19 AM · Jul 21, 2026
2.5K
Views
2
0
1
9
10
Read 2 replies