Locking Pretrained Weights via Deep Low-Rank Residual Distillation
TL;DR · AI 摘要
苹果提出DLR-Lock方法,通过低秩残差网络锁定预训练权重,使模型在保持能力的同时抵御攻击。
核心要点
- DLR-Lock利用前向-后向传播的内存不对称性,使反向传播内存随深度线性增长
- 实验验证该方法在LLM上有效阻止适应性攻击者修改权重
- 模块化蒸馏训练使DLR-Nets参数量与原MLP相当
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- DLR-Lock方法
- 防御机制
- 利用前向-后向内存不对称性
- 低秩残差网络替代MLP
- 技术优势
- 内存开销随深度增长
- 保留原始模型能力
- 验证结果
- 成功抵御适应性攻击
- LLM实验验证有效性
金句 / Highlights
值得收藏与分享的关键句。
DLR-Nets的激活内存随深度线性增长,使反向传播成本显著高于前向传播
模块化蒸馏训练使DLR-Nets参数量与原MLP保持相当
实验显示DLR-Lock在保持模型能力的同时成功抵御全知攻击者
通过深度低秩残差蒸馏锁定预训练权重 - 苹果机器学习研究
研究领域
方法与算法
内容类型
论文
发布日期
2026年8月
通过深度低秩残差蒸馏锁定预训练权重
作者 Keitaro Sakamotoâ **, Pierre Ablin, Federico Danieli, Marco Cuturi
查看出版物
复制Bibtex
近年来,开放权重语言模型的质量有了显著提升。共享权重极大地促进了模型的采用,使其能够在各种硬件和软件平台上使用。它们还允许更开放的研究和测试,用户可以将其作为检查点使用,根据需要进行微调,并可能重新分发。然而,在某些情况下,出于对这些权重被用于未经授权用途的担忧,这种自由可能带来的弊端可能超过其优势。防御此类适应性攻击并不简单:由于适应性攻击者按定义可以观察到所有权重和架构,他们可以逆转简单的结构防御,并通过优化来击败最简单的锁定机制。在本研究中,我们利用自动微分的推理-训练不对称性作为新的防御方向。我们提出了一种名为DLR-Lock的方法,模型提供者有意将模型中的每个预训练MLP替换为参数数量相当的深度低秩残差网络(DLR-Net),在反向传播过程中强制激活内存随深度线性增长。DLR-Nets通过模块级蒸馏高效训练。我们证明,除了这种内存开销外,DLR-Lock还会导致架构不匹配,使标准微调的优化景观更加复杂,并且反向传播过程产生的开销远高于前向传播。我们的防御方法在保持原始模型能力的同时,成功抵御了完全了解防御策略的适应性攻击者。在大型语言模型(LLM)上的实验验证了这些主张。
- â 东京大学
- ** 在苹果公司工作期间完成的研究
相关阅读与更新
揭示神经网络中学习子空间的利用秩
2024年7月15日 研究领域 计算机视觉 , 研究领域 方法与算法 ICML研讨会
该论文已被接受于ICML 2024基础模型高效系统研讨会。
在本研究中,我们研究神经网络学习到的权重对其可用空间的利用程度。这一概念与容量相关,但还额外考虑了网络架构与数据集的交互。大多数学习到的权重似乎都是满秩的,因此不适合低秩分解。这……
阅读更多
超越CAGE:研究学习到的自主网络防御策略的泛化能力
2022年11月30日 研究领域 方法与算法 会议 NeurIPS
该论文被接受于NeurIPS 2022“现实生活的强化学习”研讨会。
强化学习(RL)的进展启发了网络防御智能化自动化的全新方向。然而,这些进展中的许多要么超前于其在网络安全性中的应用,要么未考虑在现实世界中实施它们所面临的挑战。为理解这些问题,本研究评估了……
发现机器学习领域的机遇
我们每天都在机器学习研究中取得突破性进展。
与我们合作