Towards Data Science

The Symmetry That Breaks Neural Network Averaging

8.5内容质量

TL;DR · AI 摘要

神经网络权重平均可能因排列对称性导致性能下降,模型合并需考虑参数空间结构。

核心要点

  • 神经网络权重平均可能使模型性能下降50%以上,因排列对称性导致参数错位。
  • 模型合并成功取决于参数空间几何特性,而非凸性是适应性代价。
  • 2026年LLM工程中,模型合并需解决排列对称性带来的参数对齐难题。

结构提纲

按章节快速跳转。

  1. 揭示神经网络权重平均失效的结构性原因——排列对称性

  2. 解释神经网络通过自适应基函数学习导致非凸优化问题。

  3. 分析良好解的参数空间结构及其对模型合并的影响。

  4. 说明2026年LLM工程中模型合并的成功与失败的结构性原因。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 神经网络权重平均与排列对称性
    • 排列对称性
      • 参数错位风险
      • 权重平均失效
    • 非凸性
      • 自适应基函数代价
      • 多解共存
    • 模型合并挑战
      • 参数空间对齐
      • LLM工程实践

金句 / Highlights

值得收藏与分享的关键句。

#深度学习#神经网络#模型合并#权重平均#LLM工程
打开原文

破坏神经网络平均的对称性 | Towards Data Science

深度学习

破坏神经网络平均的对称性

理解深度学习中的置换对称性,以及它对权重平均和模型合并意味着什么

Ananya Bhattacharyya

2026年9月9日

11分钟阅读

如果你曾经尝试过在相同数据上训练相同神经网络架构两次,仅改变随机种子,你可能假设两次结果基本上可以互换。两次运行都收敛,都达到相同损失值。因此你平均两个权重向量,期望得到至少不差于任一模型的结果。

平均结果更差。通常差很多。

训练过程中没有出现问题;这是神经网络的结构性特征,可以直接从称为置换对称性的属性推导出来。同样的原理也解释了为什么模型合并有时成功有时失败,这个问题在2026年是实用大语言模型工程的核心,无论你处理的是模型混合还是联邦平均。

在符号出现之前,这里有一个直观理解方式。将两个训练好的网络想象成描述同一份报告的两个电子表格,只是列的顺序不同。模型A的"第三列"可能对应模型B的"第七列"。两个电子表格都正确,总和也相同。但如果不先对齐列就逐单元格平均,你就是在用营收数据平均员工人数。这就是朴素权重平均对神经网络所做的事,这个意象值得在下文始终记住。

大多数神经网络介绍停留在函数空间:网络计算什么,激活函数如何将直线弯曲成曲线。本文则停留在参数空间:好的解集实际呈现什么形态,这种几何特性要付出什么代价。

为什么神经网络是非凸的:自适应基函数与置换对称性

许多经典机器学习模型具有如下形式:

其中ϕ(x)=[ϕ1(x),…,ϕm(x)]⊤是一组基函数,a是系数向量。多项式回归使用ϕℓ(x)=xℓ−1。核岭回归采用隐式且实质上无限的基函数,由核k(x,x′)=∑ℓλℓψℓ(x)ψℓ(x′)定义。

在这两种情况下,我们仅学习系数a,损失是凸二次型。一个极小值,闭合解,无需随机种子。

神经网络改变了一件事:它使基函数本身可学习。每个神经元都是自适应基函数,网络通过最小化相同类型的平方误差损失,同时学习基函数和系数:

这就是核心思想。神经元是自适应基函数。我们不再需要猜测哪些特征重要。网络通过最小化下图所示的函数,同时拟合特征和系数:

这是核心权衡。非凸性不是ReLU激活的偶然结果。这是自适应的代价。固定基函数,我们获得凸性;学习基函数,我们失去凸性。没有第三种选择。

它还解释了“列顺序”问题的来源。多项式回归的列是按照惯例固定的——x、x²、x³,按此顺序提前约定。神经网络的列是与其他内容一起学习得到的,这意味着它们没有约定俗成的排列顺序。这种缺失的惯例正是排列对称性的全部来源。

非凸性的来源:排列对称性

考虑一个包含一个输入和ReLU激活函数的双神经元网络:

f(x)=ReLU(x−w1)+ReLU(x−w2)

损失函数具有对称性:交换w1和w2会得到完全相同的函数,因此损失值也相同。所以如果(w1,w2)是一个全局最小值,那么(w2,w1)同样也是全局最小值。

现在考虑这两个最小值的中点位置。根据对称性,中点是((w₁+w₂)/2, (w₁+w₂)/2),即两个神经元具有相同的参数。两个完全相同的神经元组成的网络表达能力等同于一个神经元,而非两个。除非原始神经元中有一个完全不起作用,否则这个中点不可能是最优解。

这就是全部故事。损失曲面不仅仅是崎岖不平的;它包含许多完全相同的盆地副本,这些副本由屏障分隔。对于具有m个单元的隐藏层,存在m!种等效排列方式。一个512单元的层每层会产生约512!≈10^1166个每个解的副本。这是将相同列集进行洗牌的512!种不同方式,每种方式都是同一报告的等效表格。

权重平均失败的简单双神经元示例

两个神经元和一个输入可以生成我们可以绘制的损失曲面。取

并从真实参数w=(2,6)生成200个带有高斯噪声(σ=0.3)的点:

python

code
import numpy as np
rng = np.random.default_rng(11)
relu = lambda t: np.maximum(0.0, t)
x = rng.uniform(0, 10, size=200)
y = relu(x - 2) + relu(x - 6) + rng.normal(0, 0.3, size=200)
def loss(w1, w2):
pred = relu(x[:, None] - w1) + relu(x[:, None] - w2)
return np.mean((y[:, None] - pred) ** 2, axis=0)

作者图片 左图:对数尺度下的损失曲面,两个全局最小值关于虚线w₁=w₂对称。右图:连接它们的直线上损失值的变化。

最小值成对出现。(2, 6)和(6, 2)的均方误差(MSE)均为0.093。曲面关于对角线完全对称,因为对角线是交换操作的固定集。

连接它们的直线路径会上升。中点(4, 4)的MSE为0.594——是端点损失值的6.4倍。这是一个屏障,与线性模式连接文献中测量的相同量在此二维空间中可见。

最终落在哪个最小值是随机的。从40个随机初始值运行梯度下降,47%收敛到(2, 6)顺序,53%收敛到(6, 2)。在这个示例中,种子决定了盆地选择,其他因素不起作用。

现在来看合并过程。从不同起点训练两个模型:

w_1

w_2

MSE

模型A

1.938

6.081

0.092

模型B

原始平均值(A+B)/2

4.009

0.600

对齐B后的平均值

原始平均值比任一输入差6.5倍。先对B的神经元进行排列,重新排列其列以匹配A的顺序,平均值就会回到完美模型。B计算的内容没有变化,只是标签发生了改变。

ResNet规模下的相同现象

![ResNet规模下的相同现象](/images/resnet-scale.png)

Entezari 等人(2021)推测,一旦剔除排列对称性的影响,大多数 SGD 解都会落在同一个基坑中。Ainsworth、Hayase 和 Srinivasa(2022)构建了算法来寻找对齐的排列并进行了验证:他们认为在考虑隐藏单元所有可能的排列对称性后,神经网络损失景观通常只包含几乎单个基坑,并展示了在 CIFAR-10 上独立训练的 ResNet 模型之间存在接近零屏障的线性模式连通性。两个从零开始独立训练的网络通过重新标记其中一个网络的单元后可以合并为一个,且无需任何损失惩罚。

注意事项至关重要,作者也明确指出了这些限制。对于窄模型并未观察到线性模式连通性;随着宽度增加,损失屏障逐渐消失至零,这表明该现象需要足够的容量。他们还推测排列对称性只是解释当前不变性的一个必要但不充分的条件。Jordan 等人(2023)证明,在实践中,插值后通常还需要进一步修正以修复激活统计量。

模型合并与权重平均的五个实际影响

以下五个实用规则直接源于这一几何特性:

  • 模型混合需要共同祖先:由于从相同预训练模型微调得到的检查点仍处于同一基坑内,因此在这些情况下权重平均效果良好。然而,如果各种微调使用了截然不同的学习率或正则化,它们可能会落入不同基坑,此时平均操作将失效。在平均之前必须检查插值曲线。
  • 合并无关模型需要先进行对齐:Git Re-Basin 等工具可以按排列对称性对模型进行对齐,REPAIR 则可在插值后修正激活统计量。这些步骤现在已成为任务算术或其他合并方法的标准前置步骤。
  • 权重空间距离不是相似性度量:由于两个功能相同的网络在ℓ2距离上可能相距甚远,特别是当考虑连续对称性(如缩放)时,神经元的标签是任意分配的。在追踪漂移或比较模型时,应使用表示相似性度量(如CKA)或在保留集上的输出一致性代替。
  • 在函数空间而非参数空间中进行集成:预测平均本质上具有对称不变性。权重平均则不具备这一特性。这就是为什么当模型独立训练时,深度集成通常优于权重平均模型。
  • 权重的贝叶斯后验本质上是多模态的:一个m单元层的权重后验至少有m!个相同的模态。均场变分推断将单个高斯拟合到这种多模态景观,这是它低估不确定性的原因之一。深度集成之所以有效,部分原因在于独立运行会采样不同的对称等效模态。

在应用这一想法时,需要注意这一点。ReLU网络还具有正缩放对称性:将某个神经元的输入权重(及其偏置,如果有的话)按正数常数c缩放,同时将其输出权重按1/c缩放,函数保持不变,因为ReLU具有正齐次性,即对于c>0,ReLU(cz) = c·ReLU(z)(在无偏置的网络中)。这类似于一个电子表格,其中一列以美元为单位,另一列以美分表示,即单位不同但信息相同,任何重新排列都无法发现这种差异,因为数据并未移动,只是被重新缩放了。Transformer模型更进一步。近期研究表明,在融合Transformer模型时,旋转而非仅仅是排列具有重要意义,因为注意力头具有旋转不变性,而单元重标记无法捕捉这种特性。核心结论在所有方面依然成立:模型的本质不在于参数化方式。权重是函数的坐标,不同的坐标系只是为同一点赋予了不同的名称。

一个简单的排列对齐代码片段

如果你想亲自尝试,这里有一个使用NumPy/SciPy实现的最小化代码,通过激活相关性匹配隐藏单元来对齐两个单隐藏层MLP。

code
import numpy as np
from scipy.optimize import linear_sum_assignment
def align_permutation(model_A, model_B, X_sample):
"""
使用激活相关性将模型B的隐藏单元对齐到模型A。
model_A和model_B是包含以下键的字典:
'W1': 形状为(hidden_dim, input_dim)的数组
'W2': 形状为(output_dim, hidden_dim)的数组
X_sample: 形状为(n_samples, input_dim)的数组
返回具有排列后隐藏单元的模型B新权重。
"""
W1_A, W2_A = model_A['W1'], model_A['W2']
W1_B, W2_B = model_B['W1'], model_B['W2']
# 使用ReLU的隐藏激活
act_A = np.maximum(0, X_sample @ W1_A.T)  # (n_samples, hidden_dim)
act_B = np.maximum(0, X_sample @ W1_B.T)
# A和B隐藏单元之间的相关矩阵
corr = np.corrcoef(act_A.T, act_B.T)[:act_A.shape[1], act_A.shape[1]:]
# 匈牙利算法:寻找最大化总相关性的排列
row_ind, col_ind = linear_sum_assignment(-corr)
# 排列B的输入和输出权重
perm = col_ind  # 新位置i获取原始B单元col_ind[i]
W1_B_aligned = W1_B[perm, :]
W2_B_aligned = W2_B[:, perm]
return {'W1': W1_B_aligned, 'W2': W2_B_aligned}

使用方法:

  • 使用相同数据从不同随机种子训练两个MLP。
  • 将一个小批量输入(或训练数据)作为X_sample传入。
  • 使用上述函数将模型B对齐到模型A。
  • 对齐权重后取平均并进行评估。

故事变得更加复杂的地方

尽管排列对称性解释了很多现象,但它并非全部。这里有一些常被忽略的重要注意事项:

  • 对齐后的零障碍连接并非总是成立。Entezari等人提出的猜想表明,大多数SGD解在排列对齐后可以通过接近零损失路径连接,Git Re-Basin为宽ResNets提供了证据。但这种现象并非普遍:窄网络通常仍存在障碍,不同架构或训练设置可能表现不同。始终在你自己的模型上进行验证。
  • 排列对称性并非唯一的对称性。如前所述,排列并非唯一的对称性;连续的缩放对称性也会影响权重空间几何结构。
  • “非凸性中很大一部分源于对称性”是一个假设,而非定理。对称性足以使损失函数变得非凸,但这并不意味着它在实际问题中构成了大多数障碍或非凸性的主要原因。优化几何、宽度、深度和数据也起着作用。在实践中,模型合并失败也可能源于特征不匹配、激活统计、宽度差异和训练动态——而不仅仅是排列对称性。
  • 种子并不是决定盆地的唯一因素。在玩具示例中,不同的种子会导致不同的排序。在真实网络中,架构宽度、学习率、批次顺序、优化器和数据顺序都会影响最终落入的盆地。

总结

神经网络训练中的非凸性并不神秘。它并非主要源于崎岖的地形。其中很大一部分可以精确描述为对称性,这是让网络自行学习基函数而非提前固定基函数的直接结果。凸性被换取了适应性。

一旦我们将损失景观视为每层重复 m! 次的单一盆地,一些实用规则就不再只是民间传说。在平均神经网络权重时,失败模式并非噪声,而是排列对称性。这就是为什么模型合并需要先进行对齐。模型混合需要一个共同的祖先。不同运行之间的权重空间距离毫无意义。而权重的单峰后验始终是一个强近似。

你可以在二维空间中观察这一切,使用两个神经元和三十行 NumPy 代码。

参考文献

如需进一步阅读关于神经网络权重平均、模型合并和排列对称性的内容,请参阅以下论文。

基础理论

  • C. M. Bishop, 《模式识别与机器学习》第5章。免费PDF
  • K. Kawaguchi (2016), 《无需局部极小值的深度学习》。arXiv:1605.07110

对称性与模式连接性

  • R. Entezari, H. Sedghi, O. Saukh, B. Neyshabur (2021), 《排列不变性在神经网络线性模式连接性中的作用》。arXiv:2110.06296
  • S. Ainsworth, J. Hayase, S. Srinivasa (2022), 《Git ReBasin:按排列对称性合并模型》。arXiv:2209.04836
  • T. Garipov 等人 (2018), 《损失曲面、模式连接性与深度神经网络的快速集成》。arXiv:1802.10026
  • K. Jordan 等人 (2023), 《REPAIR:通过插值修复重归一化排列激活》。arXiv:2211.08403

实践中的合并

  • M. Wortsman 等人 (2022), 《模型混合》。arXiv:2203.05482
  • E. Yang 等人 (2024), 《大语言模型、多模态语言模型及更广泛领域的模型合并》。arXiv:2408.07666
  • H. Wang 等人 (2020), 《基于匹配平均的联邦学习》。arXiv:2002.06440
  • 超越Transformer的排列对称性:旋转在模型融合中的作用 (2025)。arXiv:2502.00264

不确定性

  • P. Izmailov, S. Vikram, M. Hoffman, A. G. Wilson (2021), 《贝叶斯神经网络后验究竟如何?》。arXiv:2104.14421
  • S. Kornblith 等人 (2019), 《神经网络表示相似性的再审视(CKA)》。arXiv:1905.00414