memory 10
- Activation Recomputation 不是免费午餐:recompute 24 层 vs 16 层导致 loss 显著偏高
- Grad-norm 一直 0.21 突然飙到 50:从真实训练日志看梯度工程的六个生死细节
- seq_len 从 4K 推到 16K、CP=2 一开就慢了 20%:Ulysses Context Parallelism 的工程取舍全记录
- Qwen3-8B 下让 Gradient Checkpointing 收益最大化:选择性重算 + Pareto 曲线
- Design Spec — 训推加速三新篇:精度对齐 / Gradient Checkpointing / CUDA Graph
- 训推加速 Python 侧排障 SOP:OOM / GIL / asyncio / DataLoader / IO
- LLM 训练显存估算全指南:从 ZeRO 到 MoE
- PyTorch Profiler 显存瓶颈分析全指南(实战版)
- 训练大模型时,优化器状态到底在吃多少显存
- 免费 GPU 或廉价算力