debugging 10
- RMSNorm 后的 Layer Scalar 漂移到 56 但训练 Loss 纹丝不动:一个 Adam 优化器的隐形 Bug
- 一个 Megatron flag 把多模态梯度稀释了 17 倍:--calculate-per-token-loss 的生产事故复盘
- 把 point 当普通文本训练, UIAgent 指标直接崩了: 多模态 Special Token 的隐形碰撞
- 跨区迁移 EC2 + 一条命令把自己 SSH 踢出门:Ubuntu 24.04 socket activation 踩坑全程
- 一次重启引发的血案:SATA 瞬断如何拖垮 RAID / scemd / synopkg
- 训推加速问题定位 SOP 与 Know-how:从 GPU 低利用率到 NCCL hang 到推理吞吐
- 训推加速 Python 侧排障 SOP:OOM / GIL / asyncio / DataLoader / IO
- PyTorch Profiler 显存瓶颈分析全指南(实战版)
- PyTorch Profiler 瓶颈分析全指南(实战版)
- NVIDIA Nsight Systems 瓶颈分析全指南(实战版)