quantization 11
- SAM in Annealing: Loss Landscape Geometry Determines Quantization Robustness
- RMSNorm 后的 Layer Scalar 漂移到 56 但训练 Loss 纹丝不动:一个 Adam 优化器的隐形 Bug
- Activation Recomputation 不是免费午餐:recompute 24 层 vs 16 层导致 loss 显著偏高
- Grad-norm 一直 0.21 突然飙到 50:从真实训练日志看梯度工程的六个生死细节
- RMSNorm scalar 漂移到 56 训练 Loss 却不动:Softmax 的量化照妖镜与温度调控术
- 训练 Loss 不动但模型已坏?Adam 漂移、Softmax 饱和、梯度稀释三大隐形杀手
- Layer Scalar 不加 Weight Decay 漂到 56, 为什么 Bias 不加却安然无恙: 一个用具体数字说明的数学推导
- 训推加速技术地图:三维分类 + 全景图 + 决策流 + 大模型加速术语表
- 图像 Diffusion 训推加速深化:FLUX / SD3 / DMD2 / SageAttention
- vLLM v0.20 显存优化与推理加速实战指南
- LLM 量化(GPTQ、GGUF)实战以及效果和推理性能实测