kernels 9
- RMSNorm scalar 漂移到 56 训练 Loss 却不动:Softmax 的量化照妖镜与温度调控术
- 81% Sparsity 只掉 0.48 分却快了 7 倍:从 Flash Attention 到训练时稀疏的 IO-Aware 全景
- Attention Residual 拿了 0.025 的 loss 收益, 但 PyTorch 实现慢了 90%: Triton Kernel 怎么把开销压到 14%
- Qwen3-8B 下让 Gradient Checkpointing 收益最大化:选择性重算 + Pareto 曲线
- 替换 Fused Kernel 后如何对齐训推精度:7 类差异来源 + 3 道验证 Gate + 8 个实战技巧
- 训推加速 Qwen3 实战:从"调包"到手写 Triton Kernel(含 backward)
- 训推加速 Qwen3 实战:看懂模型结构 + 识别算子融合机会
- Design Spec — 训推加速系列:看懂 Qwen3 + Fusion 识别 + Triton 实战
- vLLM v0.20 架构深度解析:双引擎、调度器、KV Cache 与分布式推理