distillation 7
- DMD → DMD2:扩散模型一步蒸馏,从分布匹配到超越教师
- KL 散度、Cosine、Sim:大模型训练里的“相近”到底怎么量?一个数值实验告诉你它们有多不同
- RMSNorm scalar 漂移到 56 训练 Loss 却不动:Softmax 的量化照妖镜与温度调控术
- 蒸馏就是 RL、学生能超越老师:On-Policy Distillation 统一框架与六个落地范式
- 多教师蒸馏的温度工程:从 T=1 到 per-teacher adaptive temperature 的实验叙事
- 训练 Loss 不动但模型已坏?Adam 漂移、Softmax 饱和、梯度稀释三大隐形杀手
- MoE 教师 → Dense 学生:2024~2026 开源社区的落地范式