T
traeai
登录
返回首页
Yannic Kilcher视频

TiDAR: Think in Diffusion, Talk in Autoregression (Paper Analysis)

7.5内容质量
可直接观看的视频资源打开原视频

TL;DR · AI 摘要

TiDAR是一种结合扩散思想和自回归对话的模型,通过改进的训练策略提高了生成文本的质量。

核心要点

  • TiDAR结合了扩散模型和自回归模型的优点。
  • 改进的训练策略提升了生成文本的质量。
  • TiDAR在多个基准测试中表现出色。

结构提纲

按章节快速跳转。

  1. 介绍TiDAR模型及其研究背景。

  2. 详细说明TiDAR模型的组成和工作原理。

  3. 解释扩散模型如何在TiDAR中发挥作用。

  4. 解释自回归模型如何在TiDAR中发挥作用。

  5. 介绍TiDAR的改进训练策略。

  6. 展示TiDAR在基准测试中的表现。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • TiDAR模型分析

金句 / Highlights

值得收藏与分享的关键句。

#TiDAR#扩散模型#自回归模型#文本生成

视频笔记

TiDAR: 思考在扩散中,交流在自回归中(论文分析)

返回 ![图像 1](https://www.youtube.com/ "YouTube 首页")

跳过导航

搜索

用声音搜索

[](https://www.youtube.com/watch?v=taCVT5vDAk0)

登录

![图像 2](https://www.youtube.com/ "YouTube 首页")

[](https://www.youtube.com/watch?v=taCVT5vDAk0)

[](https://www.youtube.com/watch?v=taCVT5vDAk0)

[](https://www.youtube.com/watch?v=taCVT5vDAk0)

[](https://www.youtube.com/watch?v=taCVT5vDAk0)

TiDAR: 思考在扩散中,交流在自回归中(论文分析)

[](https://www.youtube.com/watch?v=taCVT5vDAk0)

轻触取消静音

2倍速

图像 3
图像 3

TiDAR: 思考在扩散中,交流在自回归中(论文分析)

Yannic Kilcher 20,540 观看次数 4个月前

[](https://www.youtube.com/watch?v=taCVT5vDAk0)

搜索

复制链接

信息

购物

图像 4
图像 4
图像 5
图像 5

如果播放无法立即开始,请尝试重新启动设备。

您已登出

您观看的视频可能会被添加到电视的观看历史记录中,并影响电视推荐。为了避免这种情况,请取消并使用计算机上的 YouTube 登录。

取消 确认

[](https://www.youtube.com/watch?v=taCVT5vDAk0)

分享

[](https://www.youtube.com/watch?v=taCVT5vDAk0 "分享链接")- [x] 包含播放列表

检索共享信息时发生错误。请稍后再试。

图像 6
图像 6

0:00

[](https://www.youtube.com/watch?v=taCVT5vDAk0)[](https://www.youtube.com/watch?v=jE9jAZC42NE "下一个 (SHIFT+n)")

0:00 / 0:00

直播

•观看完整视频

56:16 流匹配用于生成建模(论文解析)Yannic Kilcher 102K 观看次数 • 2年前 直播 播放列表 ()混合 (50+)27:34 DeepSeek 给大型语言模型带来了真正的记忆(这不是RAG)Jia-Bin Huang 53K 观看次数 • 1个月前 直播 播放列表 ()混合 (50+)27:26 大型语言模型不需要更多的参数。它们需要循环。NeuroDump 242K 观看次数 • 2个月前 直播 播放列表 ()混合 (50+)47:51 基于能量的变换器是可扩展的学习者和思考者(论文评论)Yannic Kilcher 31K 观看次数 • 9个月前 直播 播放列表 ()混合 (50+)56:27 S6 | TiDAR: 思考在扩散中,交流在自回归离散扩散阅读小组 936 观看次数 • 3个月前 直播 播放列表 ()混合 (50+)15:14 为什么推理很难..Caleb Writes Code 133K 观看次数 • 2周前 直播 播放列表 ()混合 (50+)10:39 什么是希尔伯特空间?Abide By Reason 773K 观看次数 • 11个月前 直播 播放列表 ()混合 (50+)56:51 图灵奖得主:不同意谷歌、Postgres、未来问题 | Mike Stonebraker Ryan Peterman 279K 观看次数 • 2周前 直播 播放列表 ()混合 (50+)37:25 Yann LeCun 的 10亿美元赌注反对大型语言模型 Welch Labs 382K 观看次数 • 8天前 直播 播放列表 ()混合 (50+)35:53 那个证明我们仍然不了解磁性的小小甜甜圈 Veritasium 8.2M 观看次数 • 3个月前 直播 播放列表 ()混合 (50+)27:48 我们是否只需要递归神经网络?(论文解析)Yannic Kilcher 59K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)20:28 扩散模型背后的物理学 Julia Turc 112K 观看次数 • 8个月前 直播 播放列表 ()混合 (50+)

1倍速

登录以确认您不是机器人 这有助于保护我们的社区。了解详情

登录

TiDAR: 思考在扩散中,交流在自回归中(论文分析)

图像 7
图像 7

Yannic Kilcher

Yannic Kilcher

320K 订阅者

订阅

已订阅

631

分享

保存

下载

下载

20K 观看次数 4个月前

20,540 观看次数 • 2025年12月27日

论文:https://arxiv.org/abs/2511.08923 摘要:……更多

……更多

这是如何制作的

自动配音

某些语言的音频轨道是自动生成的。了解更多

字幕

使用字幕同步观看。

显示字幕

![Image 8 ### Yannic Kilcher 320K 订阅者](https://www.youtube.com/@YannicKilcher)

视频关于

显示较少

[](https://www.youtube.com/watch?v=taCVT5vDAk0)

TiDAR: 思考扩散,谈论自回归(论文分析)

20,540 次观看 20K 次观看

2025年12月27日

631

分享

保存

下载

下载

浏览 Yannic Kilcher 商店

![Image 9 注意公式黑色马克杯 $19.99 春季暗色商品,上面印有注意公式。浏览春季](https://www.youtube.com/watch?v=taCVT5vDAk0)![Image 10 频道标志浅色马克杯 $16.99 春季商品,颜色较浅(白色或灰色),上面印有频道标志。浏览春季](https://www.youtube.com/watch?v=taCVT5vDAk0)![Image 11 频道标志深色黑色马克杯 $19.99 春季暗色商品,上面印有频道标志。浏览春季](https://www.youtube.com/watch?v=taCVT5vDAk0)![Image 12 频道标志浅色舒适T恤 $26.99 春季商品,颜色较浅(白色或灰色),上面印有频道标志。定制设计的图案使用最先进的色彩转移技术以鲜艳的颜色和高分辨率打印。衬衫由超柔软的100%精梳环纺棉制成。在美国印刷。浏览春季](https://www.youtube.com/watch?v=taCVT5vDAk0)![Image 13 频道标志浅色Next Level 3600 | 高级环纺棉T恤 $27.99 春季商品,颜色较浅(白色或灰色),上面印有频道标志。定制设计的图案使用最先进的色彩转移技术以鲜艳的颜色和高分辨率打印。衬衫由超柔软的100%精梳环纺棉制成。在美国印刷。浏览春季](https://www.youtube.com/watch?v=taCVT5vDAk0)![Image 14 频道标志浅色女士经典T恤 $27.99 春季商品,颜色较浅(白色或灰色),上面印有频道标志。定制设计的图案使用最先进的色彩转移技术以鲜艳的颜色和高分辨率打印。衬衫由超柔软的100%预缩棉制成。在美国印刷。保证可以经受数百次洗涤。浏览春季](https://www.youtube.com/watch?v=taCVT5vDAk0)

52 条评论

排序评论

热门 显示精选评论最新 显示最近的评论,包括可能的垃圾评论

Image 15: 默认头像照片
Image 15: 默认头像照片

添加评论...

Image 16
Image 16

[@aslanncs](https://www.youtube.com/@aslanncs)

4个月前

我真的很感谢 Yannic 能够很好地解释这些深度学习概念。

显示较少 阅读更多

喜欢

3

不喜欢

回复

Image 17
Image 17

[@dmitryabulkhanov8580](https://www.youtube.com/@dmitryabulkhanov8580)

4个月前(编辑)

这最好描述为一种自我推测的方法,使用分块式的起草树。名称中的“扩散”部分是一个很大的牵强,因为它从未建模一个逆后验,并且解码从不依赖于起草历史(由于拒绝采样)。

显示较少 阅读更多

喜欢

41

不喜欢

回复

2 条回复

隐藏回复

2 条回复

Image 18
Image 18

[@philiptren2792](https://www.youtube.com/@philiptren2792)

4个月前

当你看到 Yannic 再次解释解码器变换器时,就知道这是论文分析视频了!

显示较少 阅读更多

喜欢

17

不喜欢

回复

1 条回复

隐藏回复

1 条回复

Image 19
Image 19

[@vikaa6505](https://www.youtube.com/@vikaa6505)

4个月前

非常感谢!我一直期待着这个视频:)))

显示较少 阅读更多

喜欢

不喜欢

回复

Image 20
Image 20

[@mshonle](https://www.youtube.com/@mshonle)

4个月前

精彩的讲解!它真的帮助我理解了一些东西。现在我也喜欢那些精确而尖锐地批评平庸论文的视频,但在应用背景下复习基础知识也很不错!

显示较少 阅读更多

喜欢

不喜欢

回复

Image 21
Image 21

[@GooglePens](https://www.youtube.com/@GooglePens)

3个月前

2026年2月6日,我仍在等待新视频。感谢您制作的离分布和富有成果的视频。

显示较少 阅读更多

喜欢

不喜欢

回复

Image 22
Image 22

[@6c3333](https://www.youtube.com/@6c3333)

4个月前

很棒的主题!

显示较少 阅读更多

喜欢

不喜欢

回复

Image 23
Image 23

[@Mind_of_a_fool](https://www.youtube.com/@Mind_of_a_fool)

4个月前

32:30 我理解的是在这里使用推测解码时,你会总是得到已接受的标记加上一个,因为你已经检查并拒绝了某个标记,所以你知道答案。例如,如果你有EFG作为候选标记,但拒绝了F,那么你就用实际预测来替换F。因此,如果第一个标记被拒绝,那么其他所有标记都是无效的。但是这里还对已接受标记的子集进行了额外的推测以获得额外的速度提升。

显示较少 阅读更多

喜欢

3

不喜欢

回复

Image 24
Image 24

[@dumfka](https://www.youtube.com/@dumfka)

4个月前

我一直跟上进度了,现在我需要做对。我一直在做一些事情,然后论文发布了,我就想“是的,就是这样!”Image 25: 😂

显示较少 阅读更多

喜欢

不喜欢

回复

Image 26
Image 26

[@east_const](https://www.youtube.com/@east_const)

4个月前

扩散步骤怎么可能免费?如果你的模型受内存限制,那么显然为扩散模型增加更多的权重意味着更多的内存流量?

显示较少 阅读更多

喜欢

2

不喜欢

回复

Image 27
Image 27

[@paxdriver](https://www.youtube.com/@paxdriver)

4个月前

错失的机会——水平条纹本可以拼出“Bert”!Image 28: 😜

显示较少 阅读更多

喜欢

不喜欢

回复

Image 29
Image 29

[@ttul](https://www.youtube.com/@ttul)

4个月前

我认为这篇论文是不可避免的,我想知道一些封闭模型如Gemini 3是否已经以这种方式工作。我们知道模型所需的所有世界知识都已经存在于LLM的权重中;生成思维标记使模型能够通过强化学习解决新颖问题。但如果知识已经存在,为什么还要使用自回归呢?非常酷。

显示较少 阅读更多

喜欢

4

不喜欢

回复

Image 30
Image 30

[@XMaster96DE](https://www.youtube.com/@XMaster96DE)

4个月前

我不认为因果注意力允许更受限的注意力模式这一点太重要。几年前,我有一个相当密集的阶段,想要带回双向注意力,基本上是通过一种编码器-解码器模式,其中第一个提示部分是双向的,随后是因果解码部分,因为它允许更好的模式,但在模型预训练后超过10亿参数时,它总是与简单的因果注意力表现相同……

显示较少 阅读更多

喜欢

1

不喜欢

回复

Image 31
Image 31

[@impolitevegan3179](https://www.youtube.com/@impolitevegan3179)

4个月前

我希望你能深入讲解一下架构,比如什么是扩散模型,为什么是扩散,为什么不能用更小的自回归模型来做同样的事情。

显示较少 阅读更多

喜欢

1

不喜欢

回复

Image 32
Image 32

[@mithrillis](https://www.youtube.com/@mithrillis)

4个月前

有时我会想KV缓存对我们来说是不是太有效了……有很多理由相信非自回归模型应该更有优势,但它们都被“但它能使用KV缓存吗?”这个问题所阻碍。

显示较少 阅读更多

喜欢

不喜欢

回复

Image 33
Image 33

[@Timotheeee1](https://www.youtube.com/@Timotheeee1)

4个月前

“5. 限制 批量大小 虽然我们专注于批量大小=1的效率基准测试,但这并不意味着TiDAR无法处理大批量大小。我们不仅可以零样本地调整解码过程中的块长度以适应不同的计算配置文件,而且还可以在每秒浮点运算次数/标记方面实现具有竞争力的性能。”

显示较少 阅读更多

喜欢

2

不喜欢

回复

Image 34
Image 34

[@augmentos](https://www.youtube.com/@augmentos)

4个月前

这太疯狂了,我今天早上还在研究这个。

显示较少 阅读更多

喜欢

不喜欢

回复

Image 35
Image 35

[@wiktorm9858](https://www.youtube.com/@wiktorm9858)

4个月前

一篇真正出色的研究论文!🎉

显示较少 阅读更多

喜欢

不喜欢

回复

Image 36
Image 36

[@Clemm_mm](https://www.youtube.com/@Clemm_mm)

4个月前

海豹现在走了吗还是怎么了?

显示较少 阅读更多

回复

图片 38
图片 38

[@martin_nav](https://www.youtube.com/@martin_nav)

4个月前

10秒帮派

显示较少 阅读更多

11

图片 39
图片 39

❤ 由 @YannicKilcher

回复

4 条回复

隐藏回复

4 条回复

AI 可能会生成不准确的信息,请核实重要内容