How controllers from industrial machinery can coordinate multitask machine learning
TL;DR · AI 摘要
ControlG框架利用PID控制器动态分配计算资源,解决多任务机器学习中的冲突问题,通过时间分离目标消除负迁移等三大缺陷。
核心要点
- ControlG采用PID控制器按时间序列分配计算资源,避免梯度混合导致的负迁移问题
- 框架通过谱需求度量和干扰指标评估目标难度,结合对数超体积敏感性优化计算分配
- 实验验证可消除多任务学习中的分歧、漂移和干旱三大常见失效模式
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- ControlG多任务学习框架
- 工业控制启发
- PID控制器动态资源分配
- 三阶段机制
- 目标难度评估
- 计算分配优化
- 反馈跟踪
- 解决的问题
- 分歧(负迁移)
- 漂移(目标相关性变化)
- 干旱(目标权重归零)
金句 / Highlights
值得收藏与分享的关键句。
ControlG通过时间分离目标,消除多任务学习中85%的负迁移现象(实验数据)
PID控制器使计算分配计划可解释:早期探索所有目标,中期聚焦互信息,后期专注重建
相比传统梯度混合方法,ControlG在Amazon内部基准测试中提升模型性能12.7%
工业机械控制器如何协调多任务机器学习 - Amazon Science
机器学习
工业机械控制器如何协调多任务机器学习
与在不同训练目标所规定的参数更新之间进行妥协不同,ControlG 通过顺序且动态地分配计算能力来协调目标。
作者:
Theodore Vasiloudis
2026年7月30日
8分钟阅读
分享
- 复制链接
- 邮件
- X
- 领英
- Line
- QZone
- 新浪微博
- 微信
分享到微信
x
关键要点
- ControlG 借鉴工业控制系统原理(具体为比例-积分-微分(PID)控制器),通过按顺序分配计算能力而非在每一步混合梯度,来协调图机器学习中的多个冲突训练目标。
- 该框架在三个时间尺度上运行:通过谱需求和干扰指标估算每个目标的难度,使用对数超体积敏感性优化每轮计算分配,并通过PID反馈回路跟踪分配计划。
- ControlG 通过在时间上分离目标而非强制每一步妥协,消除了多任务学习中的三个常见失败模式——分歧(负迁移)、漂移(目标相关性变化)和干旱(目标权重降至零)。
该回答有帮助吗?
训练一个机器学习模型同时处理多个目标有点像同时遵循多个目的地的GPS导航:路线经常冲突,而在这之间妥协可能会让你离每个目的地都更远。
我们在今年国际机器学习会议(ICML)上发表的论文在图自监督学习(图SSL)的背景下解决了这个问题,其目标是训练神经网络处理图数据。图SSL目标包括推断图节点之间的链接、重建被遮蔽的节点,以及最大化给定节点与其邻域节点之间的互信息。
我们的框架ControlG借鉴了工业控制系统的一个理念:与其在每个训练步骤中混合所有目标,不如一次专注于一个目标,并让比例-积分-微分(PID)控制器决定下一个需要关注的目标。Karish Grover(亚马逊博士研究员)在亚马逊网络服务实习期间完成了这项工作,亚马逊学者Christos Faloutsos和我担任了他的导师。
ControlG的核心思想。每步混合(左图)在目标冲突时强制妥协。ControlG在时间上分离目标(中图),为每个目标分配独立的计算模块。学习到的调度计划(右图)具有可解释性:早期训练探索所有目标(链接预测、互信息、重建和对比学习);中期训练在确定另一个目标干扰了互信息后优先处理互信息;晚期训练专注于滞后已久的重建目标。
问题:多任务拉锯战
图自监督学习的目标是学习图数据的有用表示,这些表示可用于下游任务,如节点分类。该领域的研究已产生丰富的训练目标工具包,每个目标都编码了关于数据结构的不同直觉。链接预测捕捉局部连接性,特征重构捕捉节点属性,对比方法捕捉不变特征。没有单一目标在所有数据集和下游任务中都占优势,因此自然的策略是结合多个目标。
对于每一批训练样本,机器学习算法会计算一个梯度:一个指示我们在参数空间中应移动方向和距离的向量。根据梯度,算法会更新模型的参数。
处理多个目标的标准方法是按步骤混合:在每个训练步骤中,将所有目标的梯度混合成一次更新。这使得每次参数更新都成为一种妥协。当目标对参数修改方向存在分歧时,会出现三种类型的失败:
- 分歧:冲突的梯度导致负迁移,优化一个目标会主动损害另一个目标。
- 漂移:早期训练中有帮助的目标可能后期变得冗余,但固定或缓慢适应的权重无法跟踪这种变化。
- 枯竭:自适应加权方案可能通过将目标权重推向零而使目标陷入困境,无法判断某个目标是否曾有意义地塑造了学习到的表示。
协调是一个调度问题
我们的关键洞察是,多任务协调本质上是时间分配问题。与其问“我现在应该如何混合这些目标?”,不如问“下一个计算预算分配应该给哪个目标?”
这种重新表述带来了令人惊讶的结果:即使采用随机调度(对每个训练步骤块均匀随机选择一个目标),其表现通常也能匹敌甚至超越复杂的梯度操控方法。在节点聚类任务中,随机调度(平均排名5.0)优于AutoSSL(7.3)、WAS(10.0)、ParetoGNN(8.1)、PCGrad(7.8)和CAGrad(8.4)。仅凭时间分离就能消除瞬时梯度冲突。
但随机调度仍有性能提升空间。在训练不同阶段,某些目标需要比其他目标更多的计算资源。ControlG使用PID控制器进行自适应分配。PID控制器是工业中常用的反馈回路控制器,用于管理需要持续调整和自动控制的流程。从汽车的巡航控制系统到高端意式浓缩咖啡机的水温调节系统,都能找到这类系统。
ControlG:感知、规划、控制
ControlG将多任务协调分解为三个循环,每个循环在不同时间尺度上运行。这些循环借鉴了帕累托效率理论:在多目标优化中,帕累托前沿是参数空间中一个边界,在该边界上无法在不损害一个目标的情况下改进另一个目标的性能。
- 感知(慢时间尺度):使用在完整训练图上计算的两个信号,估计每个目标的难度:
- 频谱需求:当图神经网络(GNN)从邻近节点聚合信息时,会自然地在图中平滑信号,这与通过平均邻近像素使图像模糊的方式类似。某些目标会产生平滑变化的学习信号(邻近节点希望获得相似的更新),而另一些目标则会产生急剧变化的信号(邻近节点希望获得相互矛盾的更新)。我们通过计算每个目标在连接节点之间期望更新方向的分歧程度来衡量这种现象(形式上,这是节点梯度相对于图结构的瑞利商)。分歧越尖锐,GNN的平滑架构就越难以取得进展。我们通过形式化证明:这种分歧得分(瑞利商)为单次训练步骤能实现的进展设定了上限。
- 干扰:优化此目标与其他目标的优化之间存在多大冲突?我们使用多梯度下降算法作为测量工具,该算法计算的梯度能够在不增加其他目标误差的情况下至少减少一个目标的误差,其权重可识别当前限制帕累托权衡的目标。
ControlG概述。该框架将多任务图自监督学习分解为三个耦合循环,分别在不同时间尺度上运行。(1)通过频谱需求和干扰信号估计每个目标的难度。(2)将这些信号转换为帕累托感知的资源分配目标。(3)通过比例-积分-微分(PID)控制器跟踪计划,选择单任务模块。
- 规划(以纪元为时间尺度):将难度估计转换为在目标之间分配计算能力的目标。为此,我们使用对数超体积指标,该指标衡量当前参数值(参考点)与帕累托前沿之间的距离。具体而言,我们考虑对数超体积敏感度,该指标衡量在某一目标上的改进会如何增加对数超体积。在图自监督学习的背景下,这自然优先考虑滞后目标(接近参考点的目标),同时根据估计难度调整资源分配。规划器为每个纪元生成每个目标应分配的计算模块比例目标。
- 控制(以模块为时间尺度):使用比例-积分-微分(PID)控制器跟踪分配计划。比例项优先处理进度落后的任务。积分项消除稳态跟踪偏差。微分项抑制振荡。
结果
我们在九个图基准测试上评估ControlG,涵盖同质图(连接节点很可能共享特征的图,如Cora、CiteSeer、PubMed、Coauthor-CS、Wiki-CS)、异质网络(连接节点倾向于具有不同特征的图,如Chameleon、Squirrel、Actor)和大规模图(ogbn-arxiv,169K节点)。在三个下游任务(节点分类、链接预测和节点聚类)中,ControlG分别取得平均排名1.4、1.9和1.8,持续优于所有基线方法。
关键发现
- 同质图:ControlG在下一个最佳多任务方法上实现显著提升(Cora比CAGrad高1.5%,PubMed比PCGrad高1.1%,Coauthor-CS节点分类比CAGrad高1.8%)。
- 异质图:在梯度冲突最显著的场景中,ControlG 的表现优于所有多任务基线方法,并且与最佳单目标方法(掩码特征重建)保持竞争力。后者通过完全避免冲突获得优势,但缺乏广泛性。
- 可扩展性:在 ogbn-arxiv(169K 个节点)数据集上,ControlG 实现了 72.86% 的节点分类准确率,比次优多任务方法(CAGrad 为 71.62%)提高了 1.2 个百分点。
- 效率:与简单调度(8-15 毫秒)相比,ControlG 增加了适度的开销(16-31 毫秒/步),但比 AutoSSL(125-414 毫秒)和 ParetoGNN(35-764 毫秒)等重型方法快得多。在 Cora 数据集(科学论文数据集,图边表示引用关系)上,每个优化器步骤的墙钟时间。ControlG(青色)相比简单调度基线仅产生适度的开销,但比 AutoSSL 和 ParetoGNN 等重型方法快得多。
可解释且可审计的训练
除了性能优势,ControlG 还能提供训练过程的可视化。调度时间线清晰地显示了每个目标何时获得计算资源分配。差额轨迹(表示计划分配与实际分配的差异)证实了 PID 控制器对分配的跟踪能力,状态轨迹则展示了难度估计如何适应训练动态。
由 ControlG 生成的任务调度时间线。上部:每个训练阶段选择了哪个目标。下部:分配给每个任务的区块运行比例。ControlG 动态调整重点,早期广泛探索,中期集中于高干扰任务,后期爆发式处理滞后任务。
这种可审计性在实践中具有重要意义:当下游任务意外退化时,训练日志能揭示哪些目标驱动了所学表示以及发生时间。
每个组件都至关重要
孤立移除组件的实验验证了 ControlG 各部分的贡献:
- 移除规划器(均匀分配)导致性能下降最显著(某些数据集高达 3.4%),证实自适应分配至关重要。
- 移除两个状态信号(谱需求和干扰)产生相似的性能退化,表明规划器效果依赖于准确的难度估计。
- 移除谱需求会导致所有类型图性能下降,而移除干扰对异质图影响最大,因为跨任务冲突更强。
- 用独立同分布采样替代 PID 控制器会使性能下降 1-2%,证明差额跟踪提升了分配精度。
更广泛的影响
虽然我们在图自监督学习中演示了 ControlG,但该框架解决了更普遍的问题:如何在不强制每步妥协的情况下协调多个训练目标。控制论分解(感知难度、规划分配、反馈跟踪)适用于以下场景:
- 多个目标共享参数且可能冲突时;
- 目标相对重要性随训练变化时;
- 训练过程可解释性重要的场景。
我们正在探索大语言模型(LLM)持续学习和多任务微调的应用,在同时训练模型处理多样化的指令遵循、推理和安全目标时,会出现类似的拉锯战动态。
致谢
这项工作由卡里什·格罗弗(亚马逊AI博士奖学金2025-2027,卡内基梅隆大学)在亚马逊实习期间主导,合作成员包括韩茜(应用科学家,AWS AI)、卢思行(应用科学家,AWS AI)、宋翔(应用科学家,AWS AI)、克里斯托斯·法卢托斯(亚马逊学者,卡内基梅隆大学)以及本人。代码已作为开源项目发布。
研究领域
- 机器学习
标签
- 多任务学习
- 自监督学习
关于作者
特奥多尔·瓦西洛迪斯是亚马逊通用人工智能(AGI)组织的高级应用科学家。