Hugging Face Journal Club: AsyncOPD and How Stale Can On-Policy Distillation Be?
Hugging Face5656 字 (约 23 分钟)
85
异步策略蒸馏(AsyncOPD)在强化学习中可能导致学生策略与教师策略的log概率差异,引发不稳定性,Verl库通过k-step off-policy方法缓解此问题。
入选理由:异步方法允许生成与训练并行,但可能因策略过时导致log概率差异扩大
精选视频#强化学习#策略蒸馏#异步方法#Verl英文
