Towards demystifying the creativity of diffusion models

TL;DR · AI 摘要
Towards demystifying the creativity of diffusion models July 15, 2026 Zhengdao Chen, Research Scientist, Google Research...
核心要点
- 主题聚焦:Towards demystifying the creativity of diffusion
- 来源:Google Research Blog,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
揭开扩散模型创造力的神秘面纱
2026年7月15日
陈正道,Google Research 研究科学家
我们证明扩散模型的创造力(其生成新数据的能力,而不仅仅是记忆训练集)是神经网络学习得分函数“平滑”版本的数学结果,这种机制促使模型沿着隐藏数据流形在训练数据点之间进行插值。
快速链接
- Paper
- Code
- Share Copy link ×
扩散模型目前是生成需要复杂局部结构的任务(如图像生成和分子发现)最强大的工具之一。它们展现出超越训练数据的泛化能力,从这个意义上说,表现出“创造力”。例如,在使用真实图像数据集训练后,它们能够将随机噪声样本转化为新颖的高质量图像。
尽管这种创造能力令人印象深刻,但引发了一个引人深思的问题:这种能力究竟来自哪里?理解这个问题的答案是揭示基于扩散的生成人工智能“黑箱”性质的重要一步。
为此,在ICLR 2026上发表的论文《扩散模型中得分函数平滑的插值效应》中,我们深入探讨扩散模型的数学原理来解答这个问题。我们证明模型的创造力并非偶然,而是神经网络训练过程中自然“平滑”噪声到数据转换过程的结果。
理解去噪过程
训练扩散模型始于获取一组真实训练数据样本(如猫的图片),并故意用噪声污染它们直到完全无法辨认。然后训练模型逐步逆转这个污染过程,使其能够从纯噪声中重建出逼真的图像,这个过程称为去噪。
如果模型仅基于训练样本完美学习这个去噪过程,在部署时也应该能生成与训练样本完全一致的复制品(这种行为称为记忆)。在这种情况下,模型更像是一个检索工具,而非能够生成新内容的创造引擎。
然而在实践中,扩散模型通常能做更多事情,它们会泛化生成新的数据样本。
要理解扩散模型实际如何去噪数据,想象随机噪声是一房间内散落的气体粒子,其中“力场”将每个粒子向特定方向拉拽直到形成有意义的形状。在扩散模型中,这些移动的粒子是正在经历去噪的单个数据点,“力场”是得分函数(SF),它从训练数据中学习并决定粒子在任何时刻的流动方向。
如果模型依赖于从训练数据完美学习的得分函数,力场将把粒子引导到与训练数据点完全一致的位置(即记忆行为)。
根据image_width确定适当的宽度
对于移动图像,使用默认宽度
得分函数驱动去噪过程,将纯噪声转化为有意义的数据(如图像)。
扩散模型创造力:一维示例
我们发现扩散模型的创造力实际上源于神经网络通常学习方式的近似性:由于正则化导致的训练不完美,自然会在一个称为“得分平滑”的过程中,使所学习的得分函数出现轻微模糊。这反过来又会导致去噪过程生成的数据在训练点之间进行插值(换句话说,落在训练点之间的空间中),从而创造出新的、合理的数据样本。
想象一个仅包含两个训练数据点(+1 和 -1)的一维世界。在去噪过程的后期阶段,“完美”的得分函数看起来像下图中的曲线灰色线,该函数在两个点的中点处出现陡峭的符号变化,意味着在接近 0 的位置附近会出现快速的方向切换。换句话说,整个空间几乎被尖锐地划分为两部分,左侧的粒子被拉向 -1,右侧的粒子被拉向 +1。最终,每个粒子都会收敛到两个训练数据点中的一个,从而发生记忆现象。
“完美”的得分函数会驱动去噪过程坍缩到训练数据上,从而导致记忆现象(背景颜色及其不透明度表示拉力的方向和强度:红色表示向右,蓝色表示向左)。
然而在实践中,扩散模型无法接触到“完美”的得分函数,而是使用神经网络学习到的近似版本。由于训练过程中权重衰减的正则化效应,神经网络很难学习具有这些陡峭悬崖的函数。相反,它们倾向于学习“完美”得分函数的平滑版本,将陡峭的下降变为更温和的斜率。为了说明这一点,我们设置了一个实验,训练两层 ReLU 神经网络来拟合一维示例中的得分函数,其中神经网络的参数由流行 AdamW 算法在不同权重衰减(WD)程度下进行优化。
在正则化下训练的神经网络学习到的得分函数更加平滑。
权重衰减越强,中间区域学习到的得分函数越平滑,这意味着该区域的粒子流动速度比之前更慢,最终会停留在两个训练数据点之间的“插值区域”中。
得分平滑在训练数据点之间创建了一个“插值区域”。
在论文中,我们通过结合神经网络正则化的函数空间理论与去噪的数学方法,量化了这种联系。此外,我们的实验还表明,即使没有显式的正则化策略(如权重衰减),得分平滑也可能源于梯度下降算法训练神经网络时的隐式正则化效应。
得分平滑促进流形恢复
在现实世界中,高分辨率图像等复杂数据存在于高维像素空间,而非简单的1-D世界。然而,该空间的绝大多数区域只是对人眼毫无意义的随机噪声。只有其中一小部分数据点对应可识别的图像,它们存在于被称为数据流形的区域(就像嵌入更大空间中的一个平面)。数据流形的形状和位置在模型事先并不知晓。因此,图像生成可以被视为一个流形恢复任务,模型需要根据从流形中采样的有限训练数据推断隐藏数据流形的形态,然后在流形上生成新的点,这些点将对应新颖且有意义的图像。事实证明,分数平滑对于扩散模型实现这一目标至关重要。
值得注意的是,在多维场景中,分数平滑的效果会以方向依赖的方式体现。沿着与隐藏数据流形平行(或“切向”)的方向,其产生的减速效果与1-D场景类似。然而,沿着指向流形的方向,“完美”的分数函数本身已经相对平滑(如果流形是平坦的,甚至只是一个直线),进一步平滑不会产生显著影响。
因此,与在所有方向上对粒子流动施加制动(这会导致它们停滞在嘈杂的空旷区域,最终生成模糊图像)不同,分数平滑不会减缓粒子向流形移动的速度,而只是降低它们沿切向方向向训练数据坍缩的趋势。通过这种方式,模型在质量和新颖性之间实现了平衡:生成的图像既具有真实感(因为它们成功到达了有意义的数据流形),又具有新颖性(因为它们落在原始训练数据点之间的空白区域)。
播放静音循环视频
暂停静音循环视频
取消视频静音
静音视频
在多维场景中,分数平滑会引发一种插值效应,该效应可近似流形学习。
结论
我们的研究结果表明,我们所说的扩散模型的“创造力”实际上可能是可预测的数学结果。由于神经网络永远不会“完美”锋利,它们会在已知数据之间创建桥梁进行插值。在图像生成或药物发现中,这意味着扩散模型不仅会记住它看到的两张不同猫的图像或药物分子,还会探索它们周围的空间,提出第三种全新的图像或分子构型,该构型结合了两者的一些特征。
我们的工作只是初步揭示这一机制的尝试,当数据分布或神经网络架构变得更加复杂时会发生什么仍有待观察。尽管如此,通过展示这种行为本质上源于神经网络的学习方式,我们可以开始有意构建更好的“插值器”模型,确保它们保持创造力引擎的特性,同时避免盲目记忆的陷阱。我们还发布了用于生成论文中图表的数值实验代码。
致谢
感谢Sreenivas Gollapudi和Ravi Kumar对该项目的支持,以及Mark Simborg和Kimberly Schwede在准备这篇博文时的帮助。
- 标签:
- 算法与理论
- 生成式AI
- 机器智能
其他相关文章
- 2026年7月9日 SensorFM:面向可穿戴健康数据的通用智能与接口 生成式AI · 机器智能
- 2026年7月7日 协作的力量:我们如何减少交通拥堵 算法与理论 · 气候与可持续性 · 数据挖掘与建模
- 2026年6月30日 推出TabFM:面向表格数据的零样本基础模型 数据管理 · 机器智能 · 产品
×
❮
❯