optimizer 12
- RMSNorm 后的 Layer Scalar 漂移到 56 但训练 Loss 纹丝不动:一个 Adam 优化器的隐形 Bug
- Grad-norm 一直 0.21 突然飙到 50:从真实训练日志看梯度工程的六个生死细节
- RMSNorm scalar 漂移到 56 训练 Loss 却不动:Softmax 的量化照妖镜与温度调控术
- 一个 Megatron flag 把多模态梯度稀释了 17 倍:--calculate-per-token-loss 的生产事故复盘
- Loss Spike 频率降了 80%:从 Adam 到 MuonClip,万亿参数 MoE 的优化器进化实战
- 为什么多模态训练不要 Warmup:从四份真实 LR 配置看学习率调度的工程哲学
- Router 梯度和 Expert 梯度分开裁剪, Loss Spike 频率降了 80%: MoE 训练稳定性的优化器视角
- 512 Expert 里 80% 是死的:从 MuonClip 到 Expert Upcycling,MoE 训练稳定性的三个生死问题
- 训练 Loss 不动但模型已坏?Adam 漂移、Softmax 饱和、梯度稀释三大隐形杀手
- Layer Scalar 不加 Weight Decay 漂到 56, 为什么 Bias 不加却安然无恙: 一个用具体数字说明的数学推导
- Moonshot Kimi 系列技术洞察:从 K1.5 到 K2.6 的架构、优化器、训推工程
- 训练大模型时,优化器状态到底在吃多少显存