TiDAR: Think in Diffusion, Talk in Autoregression (Paper Analysis)
TL;DR · AI 摘要
TiDAR是一种结合扩散思想和自回归对话的模型,通过改进的训练策略提高了生成文本的质量。
核心要点
- TiDAR结合了扩散模型和自回归模型的优点。
- 改进的训练策略提升了生成文本的质量。
- TiDAR在多个基准测试中表现出色。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- TiDAR模型分析
金句 / Highlights
值得收藏与分享的关键句。
TiDAR结合了扩散模型和自回归模型的优点,从而提高了生成文本的质量。
改进的训练策略使得TiDAR在多个基准测试中表现出色。
TiDAR在基准测试中取得了显著的性能提升。
视频笔记
TiDAR: 思考在扩散中,交流在自回归中(论文分析)
返回 
跳过导航
搜索
用声音搜索
[](https://www.youtube.com/watch?v=taCVT5vDAk0)

[](https://www.youtube.com/watch?v=taCVT5vDAk0)
[](https://www.youtube.com/watch?v=taCVT5vDAk0)
[](https://www.youtube.com/watch?v=taCVT5vDAk0)
[](https://www.youtube.com/watch?v=taCVT5vDAk0)
[](https://www.youtube.com/watch?v=taCVT5vDAk0)
轻触取消静音
2倍速
TiDAR: 思考在扩散中,交流在自回归中(论文分析)
Yannic Kilcher 20,540 观看次数 4个月前
[](https://www.youtube.com/watch?v=taCVT5vDAk0)
搜索
复制链接
信息
购物
如果播放无法立即开始,请尝试重新启动设备。
•
您已登出
您观看的视频可能会被添加到电视的观看历史记录中,并影响电视推荐。为了避免这种情况,请取消并使用计算机上的 YouTube 登录。
取消 确认
[](https://www.youtube.com/watch?v=taCVT5vDAk0)
分享
[](https://www.youtube.com/watch?v=taCVT5vDAk0 "分享链接")- [x] 包含播放列表
检索共享信息时发生错误。请稍后再试。
0:00
[](https://www.youtube.com/watch?v=taCVT5vDAk0)[](https://www.youtube.com/watch?v=jE9jAZC42NE "下一个 (SHIFT+n)")
0:00 / 0:00
直播
•观看完整视频
•
•
56:16 流匹配用于生成建模(论文解析)Yannic Kilcher 102K 观看次数 • 2年前 直播 播放列表 ()混合 (50+)27:34 DeepSeek 给大型语言模型带来了真正的记忆(这不是RAG)Jia-Bin Huang 53K 观看次数 • 1个月前 直播 播放列表 ()混合 (50+)27:26 大型语言模型不需要更多的参数。它们需要循环。NeuroDump 242K 观看次数 • 2个月前 直播 播放列表 ()混合 (50+)47:51 基于能量的变换器是可扩展的学习者和思考者(论文评论)Yannic Kilcher 31K 观看次数 • 9个月前 直播 播放列表 ()混合 (50+)56:27 S6 | TiDAR: 思考在扩散中,交流在自回归离散扩散阅读小组 936 观看次数 • 3个月前 直播 播放列表 ()混合 (50+)15:14 为什么推理很难..Caleb Writes Code 133K 观看次数 • 2周前 直播 播放列表 ()混合 (50+)10:39 什么是希尔伯特空间?Abide By Reason 773K 观看次数 • 11个月前 直播 播放列表 ()混合 (50+)56:51 图灵奖得主:不同意谷歌、Postgres、未来问题 | Mike Stonebraker Ryan Peterman 279K 观看次数 • 2周前 直播 播放列表 ()混合 (50+)37:25 Yann LeCun 的 10亿美元赌注反对大型语言模型 Welch Labs 382K 观看次数 • 8天前 直播 播放列表 ()混合 (50+)35:53 那个证明我们仍然不了解磁性的小小甜甜圈 Veritasium 8.2M 观看次数 • 3个月前 直播 播放列表 ()混合 (50+)27:48 我们是否只需要递归神经网络?(论文解析)Yannic Kilcher 59K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)20:28 扩散模型背后的物理学 Julia Turc 112K 观看次数 • 8个月前 直播 播放列表 ()混合 (50+)
1倍速
登录以确认您不是机器人 这有助于保护我们的社区。了解详情
TiDAR: 思考在扩散中,交流在自回归中(论文分析)
Yannic Kilcher
320K 订阅者
订阅
已订阅
631
分享
保存
下载
下载
20K 观看次数 4个月前
20,540 观看次数 • 2025年12月27日
论文:https://arxiv.org/abs/2511.08923 摘要:……更多
……更多
这是如何制作的
自动配音
某些语言的音频轨道是自动生成的。了解更多
字幕
使用字幕同步观看。
显示字幕

显示较少
[](https://www.youtube.com/watch?v=taCVT5vDAk0)
TiDAR: 思考扩散,谈论自回归(论文分析)
20,540 次观看 20K 次观看
2025年12月27日
631
分享
保存
下载
下载
浏览 Yannic Kilcher 商店

52 条评论
排序评论
按
添加评论...
[@aslanncs](https://www.youtube.com/@aslanncs)
我真的很感谢 Yannic 能够很好地解释这些深度学习概念。
显示较少 阅读更多
喜欢
3
不喜欢
回复
[@dmitryabulkhanov8580](https://www.youtube.com/@dmitryabulkhanov8580)
这最好描述为一种自我推测的方法,使用分块式的起草树。名称中的“扩散”部分是一个很大的牵强,因为它从未建模一个逆后验,并且解码从不依赖于起草历史(由于拒绝采样)。
显示较少 阅读更多
喜欢
41
不喜欢
回复
2 条回复
隐藏回复
2 条回复
[@philiptren2792](https://www.youtube.com/@philiptren2792)
当你看到 Yannic 再次解释解码器变换器时,就知道这是论文分析视频了!
显示较少 阅读更多
喜欢
17
不喜欢
回复
1 条回复
隐藏回复
1 条回复
[@vikaa6505](https://www.youtube.com/@vikaa6505)
非常感谢!我一直期待着这个视频:)))
显示较少 阅读更多
喜欢
不喜欢
回复
[@mshonle](https://www.youtube.com/@mshonle)
精彩的讲解!它真的帮助我理解了一些东西。现在我也喜欢那些精确而尖锐地批评平庸论文的视频,但在应用背景下复习基础知识也很不错!
显示较少 阅读更多
喜欢
不喜欢
回复
[@GooglePens](https://www.youtube.com/@GooglePens)
2026年2月6日,我仍在等待新视频。感谢您制作的离分布和富有成果的视频。
显示较少 阅读更多
喜欢
不喜欢
回复
[@6c3333](https://www.youtube.com/@6c3333)
很棒的主题!
显示较少 阅读更多
喜欢
不喜欢
回复
[@Mind_of_a_fool](https://www.youtube.com/@Mind_of_a_fool)
32:30 我理解的是在这里使用推测解码时,你会总是得到已接受的标记加上一个,因为你已经检查并拒绝了某个标记,所以你知道答案。例如,如果你有EFG作为候选标记,但拒绝了F,那么你就用实际预测来替换F。因此,如果第一个标记被拒绝,那么其他所有标记都是无效的。但是这里还对已接受标记的子集进行了额外的推测以获得额外的速度提升。
显示较少 阅读更多
喜欢
3
不喜欢
回复
[@dumfka](https://www.youtube.com/@dumfka)
我一直跟上进度了,现在我需要做对。我一直在做一些事情,然后论文发布了,我就想“是的,就是这样!”
显示较少 阅读更多
喜欢
不喜欢
回复
[@east_const](https://www.youtube.com/@east_const)
扩散步骤怎么可能免费?如果你的模型受内存限制,那么显然为扩散模型增加更多的权重意味着更多的内存流量?
显示较少 阅读更多
喜欢
2
不喜欢
回复
[@paxdriver](https://www.youtube.com/@paxdriver)
错失的机会——水平条纹本可以拼出“Bert”!
显示较少 阅读更多
喜欢
不喜欢
回复
[@ttul](https://www.youtube.com/@ttul)
我认为这篇论文是不可避免的,我想知道一些封闭模型如Gemini 3是否已经以这种方式工作。我们知道模型所需的所有世界知识都已经存在于LLM的权重中;生成思维标记使模型能够通过强化学习解决新颖问题。但如果知识已经存在,为什么还要使用自回归呢?非常酷。
显示较少 阅读更多
喜欢
4
不喜欢
回复
[@XMaster96DE](https://www.youtube.com/@XMaster96DE)
我不认为因果注意力允许更受限的注意力模式这一点太重要。几年前,我有一个相当密集的阶段,想要带回双向注意力,基本上是通过一种编码器-解码器模式,其中第一个提示部分是双向的,随后是因果解码部分,因为它允许更好的模式,但在模型预训练后超过10亿参数时,它总是与简单的因果注意力表现相同……
显示较少 阅读更多
喜欢
1
不喜欢
回复
[@impolitevegan3179](https://www.youtube.com/@impolitevegan3179)
我希望你能深入讲解一下架构,比如什么是扩散模型,为什么是扩散,为什么不能用更小的自回归模型来做同样的事情。
显示较少 阅读更多
喜欢
1
不喜欢
回复
[@mithrillis](https://www.youtube.com/@mithrillis)
有时我会想KV缓存对我们来说是不是太有效了……有很多理由相信非自回归模型应该更有优势,但它们都被“但它能使用KV缓存吗?”这个问题所阻碍。
显示较少 阅读更多
喜欢
不喜欢
回复
[@Timotheeee1](https://www.youtube.com/@Timotheeee1)
“5. 限制 批量大小 虽然我们专注于批量大小=1的效率基准测试,但这并不意味着TiDAR无法处理大批量大小。我们不仅可以零样本地调整解码过程中的块长度以适应不同的计算配置文件,而且还可以在每秒浮点运算次数/标记方面实现具有竞争力的性能。”
显示较少 阅读更多
喜欢
2
不喜欢
回复
[@augmentos](https://www.youtube.com/@augmentos)
这太疯狂了,我今天早上还在研究这个。
显示较少 阅读更多
喜欢
不喜欢
回复
[@wiktorm9858](https://www.youtube.com/@wiktorm9858)
一篇真正出色的研究论文!🎉
显示较少 阅读更多
喜欢
不喜欢
回复
[@Clemm_mm](https://www.youtube.com/@Clemm_mm)
海豹现在走了吗还是怎么了?
显示较少 阅读更多
赞
踩
回复
[@martin_nav](https://www.youtube.com/@martin_nav)
10秒帮派
显示较少 阅读更多
赞
11
踩
❤ 由 @YannicKilcher
回复
4 条回复
隐藏回复
4 条回复