Accelerating Text-to-Video Generation with Calibrated Sparse Attention
TL;DR · AI 摘要
Apple提出CalibAtt方法,通过校准稀疏注意力机制实现视频生成加速,最高达1.58倍。
核心要点
- CalibAtt方法在Wan 2.1 14B等模型上实现最高1.58倍端到端加速
- 离线校准阶段可识别跨输入稳定的块级稀疏模式
- 该方法在保持视频生成质量的同时无需额外训练
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Calibrated Sparse Attention
- 问题定义
- 扩散模型计算瓶颈
- 核心方法
- 离线校准
- 稀疏注意力优化
- 实验结果
- 1.58倍加速
- 质量保持
金句 / Highlights
值得收藏与分享的关键句。
CalibAtt在保持视频生成质量的同时实现最高1.58倍加速
离线校准阶段可识别跨输入稳定的块级稀疏模式
该方法无需额外训练即可实现注意力计算优化
通过校准稀疏注意力加速文本到视频生成 - 苹果机器学习研究
研究领域
计算机视觉
会议
ECCV
内容类型
论文
发布日期
2026年7月
通过校准稀疏注意力加速文本到视频生成
作者 Shai Yehezkelâ **, Shahar Yadin, Noam Elata, Yaron Ostrovsky-Berman, Bahjat Kawar
查看出版物
复制Bibtex
近年来,扩散模型实现了高质量的视频生成,但存在运行速度慢的问题。这些模型中使用的大型基于Transformer的主干网络受到时空注意力的限制。在本文中,我们发现大量token到token的连接在各种输入中始终产生可忽略的分数,且它们的模式在查询中经常重复。因此,在这些情况下,可以跳过注意力计算而对结果影响极小。这一观察对于局部token块之间的连接同样适用。受此启发,我们引入了CalibAtt(校准稀疏注意力),这是一种无需训练的方法,通过校准稀疏注意力加速视频生成。CalibAtt执行离线校准过程,识别在不同输入中稳定的块级稀疏性和重复模式,并为每一层、每个注意力头和扩散时间步编译优化的注意力操作。在推理时,我们密集计算选定的输入相关连接,以硬件高效的方式跳过未选定的连接。在Wan 2.1 14B、Mochi 1和不同分辨率下的少量步骤蒸馏模型上的大量实验表明,CalibAtt实现了高达1.58倍的端到端加速,在保持视频生成质量和文视频对齐的同时,优于现有的无训练方法。
- â特拉维夫大学
- **在苹果工作期间完成的研究
相关阅读和更新
VideoFlexTok:灵活长度的粗到细视频分词
2026年7月2日 研究领域 计算机视觉 会议 ICML
视觉分词器将高维原始像素映射到压缩表示以供下游建模。除了压缩之外,分词器还决定了保留哪些信息以及如何组织这些信息。视频分词的公认标准方法是将视频表示为时空3D网格的token,每个token捕获原始信号中对应的局部信息。这要求下游模型消耗的...
阅读更多
STARFlow-V:使用归一化流的端到端视频生成建模
2026年4月30日 研究领域 计算机视觉 , 研究领域 方法和算法 会议 CVPR
归一化流(NFs)是针对连续数据的端到端基于似然的生成模型,最近在图像生成方面取得了令人鼓舞的进展,重新受到关注。然而在视频生成领域,时空复杂性和计算成本显著更高,最先进的系统几乎完全依赖于扩散模型。在本工作中,我们通过提出STARFlow-V重新审视这一设计空间,...
发现机器学习领域的机遇
我们的机器学习研究每天都在取得新突破。
与我们合作 /think