triton 5 Attention Residual 拿了 0.025 的 loss 收益, 但 PyTorch 实现慢了 90%: Triton Kernel 怎么把开销压到 14% Jun 10, 2026 替换 Fused Kernel 后如何对齐训推精度:7 类差异来源 + 3 道验证 Gate + 8 个实战技巧 May 8, 2026 Qwen3-8B 下 CUDA Graph 的合理使用:训练 / 推理分场景 + 陷阱清单 May 8, 2026 训推加速 Qwen3 实战:从"调包"到手写 Triton Kernel(含 backward) May 7, 2026 Design Spec — 训推加速系列:看懂 Qwen3 + Fusion 识别 + Triton 实战 May 7, 2026