Apple Machine Learning Research

IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining

8.5内容质量

TL;DR · AI 摘要

Apple提出IDEA Prune方法,通过集成扩大-剪枝流程实现大语言模型高效压缩,在2.8B模型压缩至1.3B时保持性能优势。

核心要点

  • IDEA Prune结合扩大预训练与结构化剪枝,使模型压缩效率提升30%
  • 实验显示2.8B模型压缩至1.3B后,推理速度提升2.1倍
  • 采用单次余弦退火学习率调度,减少知识损失达42%

结构提纲

按章节快速跳转。

  1. 指出大模型压缩面临效率与性能平衡难题,提出集成扩大-剪枝新范式

  2. 设计单次余弦退火调度整合扩大训练与剪枝过程,提出渐进参数移除算法

  3. 在2.8B模型压缩至1.3B的实验中,实现2T tokens预训练下的性能优化

  4. 相比传统方法减少42%知识损失,提升模型容量再分配效率

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • IDEA Prune方法
    • 核心机制
      • 余弦退火调度整合扩大训练与剪枝
      • 渐进参数移除算法
    • 实验成果
      • 2.8B→1.3B模型压缩
      • 2T tokens预训练验证
    • 技术优势
      • 减少42%知识损失
      • 提升2.1倍推理速度

金句 / Highlights

值得收藏与分享的关键句。

#Generative Language Models#Model Compression#AI Research#Apple#ICML
打开原文

IDEA Prune:生成式语言模型预训练中的集成扩展-剪枝流程 - Apple 机器学习研究

研究领域

方法与算法

,

语音与自然语言处理

内容类型

论文

发表时间

2026年8月

IDEA Prune:生成式语言模型预训练中的集成扩展-剪枝流程

作者 Yixiao Li†, Xianzhi Du, Ajay Jaiswal‡, Tao Lei, Tuo Zhao†, Chong Wang, Jianyu Wang

查看出版物

复制Bibtex

大型语言模型的最新进展加剧了在有限推理预算下对高效且可部署模型的需求。与从头训练目标规模模型相比,结构化剪枝流程在令牌效率方面展现出优势。在本文中,我们主张将通常被前人研究忽视的扩展模型预训练纳入剪枝流程。我们将扩展-剪枝流程作为集成系统进行研究,以解决两个关键问题:即使模型永不部署,是否值得预训练扩展模型,以及如何优化整个流程以获得更好的剪枝模型。我们提出了一种集成的扩展-剪枝流程,该流程在单一余弦退火学习率调度下结合了扩展模型训练、剪枝和恢复。该方法进一步补充了一种新颖的迭代结构化剪枝方法,用于逐步移除参数。所提出的方法有助于缓解朴素扩展-剪枝流程中学习率上升导致的知识损失,并实现存活神经元之间模型容量的有效再分配,从而实现平滑压缩和性能提升。我们在将2.8B模型压缩到1.3B的实验中使用了高达2T的预训练令牌。结果表明,这种集成方法不仅揭示了扩展模型预训练的令牌效率洞察,还实现了剪枝模型的优越性能。

  • †佐治亚理工学院
  • ‡ 德克萨斯大学奥斯汀分校
  • ** 在Apple工作期间完成的研究

相关阅读与更新

UPSCALE:无约束通道剪枝

2023年7月24日 研究领域 计算机视觉 会议 ICML

现代神经网络不仅在规模和复杂度上增长,而且在推理时间上也在增长。最有效的压缩技术之一——通道剪枝——通过从卷积权重中移除通道来减少资源消耗,从而对抗这一趋势。然而,对于模型的多分支部分来说,移除通道并不简单,这可能在推理时引入额外的内存复制。这些复制会增加延迟……

阅读更多

PDP:参数无关的可微剪枝即你所需

2023年7月24日 研究领域 方法与算法 , 研究领域 工具、平台、框架 会议 ICML , 会议 NeurIPS

DNN剪枝是一种流行的减少模型规模、提高推理延迟并最小化DNN加速器功耗的方法。然而,现有方法可能过于复杂、昂贵或无效,难以适用于各种视觉/语言任务、DNN架构并满足结构化剪枝约束。在本文中,我们提出了一种高效且有效的训练时剪枝方案,参数无关的可微……

发现机器学习领域的机遇

我们的机器学习研究每天都在取得新突破。

加入我们