Qwen(@Alibaba_Qwen)
Amazing! 🥳 Thanks @vllm_project for getting Qwen3.8-Flash-Next running on NVIDIA and AMD from day 0...
6.5内容质量

TL;DR · AI 摘要
通义千问模型Qwen3.8-Flash-Next在vLLM框架下实现NVIDIA和AMD GPU的原生支持,但技术细节披露有限。
核心要点
- Qwen3.8-Flash-Next采用125B参数的超稀疏MoE架构,仅6B参数处于激活状态
- 支持通过YaRN技术扩展至1M参数规模
- 包含可卸载的51B N-gram表组件
结构提纲
按章节快速跳转。
宣布Qwen3.8-Flash-Next获得vLLM框架的跨平台支持
介绍超稀疏MoE架构的参数规模和激活机制
说明通过YaRN实现的参数扩展能力和N-gram表卸载方案
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Qwen3.8-Flash-Next
- 跨平台支持
- NVIDIA GPU
- AMD GPU
- 架构特性
- 125B参数MoE
- 6B激活参数
- YaRN扩展
- 优化设计
- 51B N-gram表卸载
金句 / Highlights
值得收藏与分享的关键句。
Ultra-sparse multimodal MoE: 125B params, 6B active, 262K native, 1M via YaRN
Separate 51B N-gram table can be offloaded for memory optimization
Day-0 support on NVIDIA and AMD GPUs through vLLM framework
#Qwen#vLLM#AI模型#GPU支持
打开原文Qwen on X: "Amazing! 🥳 Thanks @vllm_project for getting Qwen3.8-Flash-Next running on NVIDIA and AMD from day 0." / X
Qwen
@Alibaba_Qwen
Amazing! 🥳 Thanks
@
vllm_project
for getting Qwen3.8-Flash-Next running on NVIDIA and AMD from day 0.
vLLM
@vllm_project
13h
Qwen3.8-Flash-Next from
Alibaba_Qwen
has day-0 support in vLLM, verified on NVIDIA and AMD GPUs. 🎉 Ultra-sparse multimodal MoE: 125B params, 6B active, 262K native, 1M via YaRN. On top of those sits a separate 51B N-gram table you can offload. Most of it will look familiar.
Show more
1:17 PM · Aug 26, 2026
36.1K
Views
23
16
469
38