向阳乔木(@vista8)

一直好奇,为啥最近大模型参数都能上 T,且质量超好? 感觉跟新模型构架有关系。 从一篇文章发现个叫 Gated Delta Networks 的东西,建立在Mamba思想上。 无论英伟达的Nem...

8.5内容质量
一直好奇,为啥最近大模型参数都能上 T,且质量超好?

感觉跟新模型构架有关系。

从一篇文章发现个叫 Gated Delta Networks 的东西,建立在Mamba思想上。

无论英伟达的Nem...

TL;DR · AI 摘要

大模型参数规模突破T级得益于新型架构如Gated Delta Networks和Mamba的创新,英伟达、Kimi、Qwen等均采用混合架构优化性能。

核心要点

  • Gated Delta Networks基于Mamba思想,提升模型效率。
  • 英伟达Nemotron和Qwen采用混合架构优化性能。
  • Kimi Delta Attention通过动态注意力机制增强质量。

结构提纲

按章节快速跳转。

  1. 提出大模型参数突破T级与新型架构的关系疑问。

  2. 解析Gated Delta Networks基于Mamba思想的创新原理。

  3. 对比英伟达Nemotron、Kimi Delta Attention、Qwen的混合架构设计。

  4. 混合架构如何实现参数规模与质量的双重突破。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 大模型架构创新
    • Gated Delta Networks
      • Mamba思想
    • 混合架构案例
      • 英伟达Nemotron
      • Qwen
      • Kimi Delta Attention

金句 / Highlights

值得收藏与分享的关键句。

#大模型#Mamba#Gated Delta Networks#英伟达#Qwen
打开原文

向阳乔木 on X: "一直好奇,为啥最近大模型参数都能上 T,且质量超好? 感觉跟新模型构架有关系。 从一篇文章发现个叫 Gated Delta Networks 的东西,建立在Mamba思想上。 无论英伟达的Nemotron 模型、还是Kimi的Kimi Delta Attention,Qwen 的最新模型构架。 都是类似混合构架,有必要今天好好学习下这篇论文。 https://t.co/1wAFggD9Pz" / X

向阳乔木

@vista8

一直好奇,为啥最近大模型参数都能上 T,且质量超好? 感觉跟新模型构架有关系。 从一篇文章发现个叫 Gated Delta Networks 的东西,建立在Mamba思想上。 无论英伟达的Nemotron 模型、还是Kimi的Kimi Delta Attention,Qwen 的最新模型构架。 都是类似混合构架,有必要今天好好学习下这篇论文。

4:19 AM · Jul 21, 2026

2.5K

Views

2

0

1

9

10

Read 2 replies