李继刚(@lijigang_com)
日读论文:模型,有家谱。 ──────── https://t.co/Pws6SOEvoN 一个老师只用数字串教学生,比如 "(285, 574, 384, ...)",里面没有半个字提到「猫头...
8.7内容质量

TL;DR · AI 摘要
论文揭示模型蒸馏中存在隐式信息传递:即使训练数据不含敏感语义,同源初始化的学生模型仍会继承教师的行为偏好。
核心要点
- 同源初始化的模型可通过数据中的数字分布隐式传递行为特征
- 传统过滤语义内容无法阻断此类隐式学习
- 该现象源于共享权重结构下的梯度更新机制,具普遍性
#大模型#模型蒸馏#隐式学习#AI安全#神经网络
打开原文────────
https://t.co/IdslRNuefo
一个老师只用数字串教学生,比如 "(285, 574, 384, ...)",里面没有半个字提到「猫头鹰」。可学生学完之后,回答各种无关问题时,偏好猫头鹰的概率明显升高。这怎么可能?" / X
李继刚 on X: "日读论文:模型,有家谱。 ──────── https://t.co/IdslRNuefo 一个老师只用数字串教学生,比如 "(285, 574, 384, ...)",里面没有半个字提到「猫头鹰」。可学生学完之后,回答各种无关问题时,偏好猫头鹰的概率明显升高。这怎么可能?" / X
JavaScript is not available.
We’ve detected that JavaScript is disabled in this browser. Please enable JavaScript or switch to a supported browser to continue using x.com. You can see a list of supported browsers in our Help Center.