pytorch 14
- up_proj 和 gated_proj 共享权重减 50% FFN 参数: 16 个验证集全部退化的干净失败
- RMSNorm 后的 Layer Scalar 漂移到 56 但训练 Loss 纹丝不动:一个 Adam 优化器的隐形 Bug
- 长文 Loss 突然涨了 0.004:一次 RoPE × SWA 的冲突复盘与位置编码扩展全解
- 一个 Megatron flag 把多模态梯度稀释了 17 倍:--calculate-per-token-loss 的生产事故复盘
- CoLA 放在 up_proj 收敛快 2.3 倍: FFN 内部低秩最优落点的定位实验
- MoE 训练加速实战:DeepEP + Grouped GeMM + Aux-Loss-Free 的 Qwen3.5 配方
- Qwen3-8B 下让 Gradient Checkpointing 收益最大化:选择性重算 + Pareto 曲线
- Qwen3-8B 下 CUDA Graph 的合理使用:训练 / 推理分场景 + 陷阱清单
- 训推加速 Qwen3 实战:从"调包"到手写 Triton Kernel(含 backward)
- 训推加速问题定位 SOP 与 Know-how:从 GPU 低利用率到 NCCL hang 到推理吞吐
- 训推加速 Qwen3 实战:看懂模型结构 + 识别算子融合机会
- PyTorch Profiler 显存瓶颈分析全指南(实战版)
- PyTorch Profiler 瓶颈分析全指南(实战版)
- NVIDIA Nsight Systems 瓶颈分析全指南(实战版)