何恺明首个语言模型:105M参数,不走GPT自回归老路
量子位2865 字 (约 12 分钟)
85
何恺明团队推出首个连续扩散语言模型ELF,仅用105M参数和45B训练token,在OpenWebText上将生成困惑度降至24,优于主流扩散语言模型。
入选理由:ELF采用连续扩散方法,仅需32步采样,生成困惑度达到24,优于主流扩散模型。
精选文章#扩散语言模型#连续扩散#何恺明#ELF#NLP中文
人物
别名:Kaiming He
中国计算机视觉专家,曾获多项国际大奖。
已跟踪 1 条高相关材料
最近变化
2026-05-13 · ELF采用连续扩散方法,仅需32步采样,生成困惑度达到24,优于主流扩散模型。
为什么值得关注
何恺明 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
已收录 1 条与 何恺明 相关的内容,按评分排序。
何恺明团队推出首个连续扩散语言模型ELF,仅用105M参数和45B训练token,在OpenWebText上将生成困惑度降至24,优于主流扩散语言模型。
入选理由:ELF采用连续扩散方法,仅需32步采样,生成困惑度达到24,优于主流扩散模型。