stability 7
- SAM in Annealing: Loss Landscape Geometry Determines Quantization Robustness
- MoE 做 RL 训练时 Routing 决策飘了:一个零成本的 Replay 方案消除了精度不一致
- Grad-norm 一直 0.21 突然飙到 50:从真实训练日志看梯度工程的六个生死细节
- Loss Spike 频率降了 80%:从 Adam 到 MuonClip,万亿参数 MoE 的优化器进化实战
- 只在 Answer 上算 Loss、MTP λ=0.3 到底带来多少:从实验配置反推 Loss 设计的工程决策
- Router 梯度和 Expert 梯度分开裁剪, Loss Spike 频率降了 80%: MoE 训练稳定性的优化器视角
- 512 Expert 里 80% 是死的:从 MuonClip 到 Expert Upcycling,MoE 训练稳定性的三个生死问题