李继刚(@lijigang_com)

日读论文:模型,有家谱。 ──────── https://t.co/Pws6SOEvoN 一个老师只用数字串教学生,比如 "(285, 574, 384, ...)",里面没有半个字提到「猫头...

8.7内容质量
日读论文:模型,有家谱。

────────

https://t.co/Pws6SOEvoN

一个老师只用数字串教学生,比如 "(285, 574, 384, ...)",里面没有半个字提到「猫头...

TL;DR · AI 摘要

论文揭示模型蒸馏中存在隐式信息传递:即使训练数据不含敏感语义,同源初始化的学生模型仍会继承教师的行为偏好。

核心要点

  • 同源初始化的模型可通过数据中的数字分布隐式传递行为特征
  • 传统过滤语义内容无法阻断此类隐式学习
  • 该现象源于共享权重结构下的梯度更新机制,具普遍性
#大模型#模型蒸馏#隐式学习#AI安全#神经网络
打开原文

────────

https://t.co/IdslRNuefo

一个老师只用数字串教学生,比如 "(285, 574, 384, ...)",里面没有半个字提到「猫头鹰」。可学生学完之后,回答各种无关问题时,偏好猫头鹰的概率明显升高。这怎么可能?" / X

李继刚 on X: "日读论文:模型,有家谱。 ──────── https://t.co/IdslRNuefo 一个老师只用数字串教学生,比如 "(285, 574, 384, ...)",里面没有半个字提到「猫头鹰」。可学生学完之后,回答各种无关问题时,偏好猫头鹰的概率明显升高。这怎么可能?" / X

JavaScript is not available.

We’ve detected that JavaScript is disabled in this browser. Please enable JavaScript or switch to a supported browser to continue using x.com. You can see a list of supported browsers in our Help Center.

Help Center