qwen 8
- Speculative Decoding 实战:vLLM 框架下 EAGLE-3 原理与工程落地
- RL 训练加速实战:Qwen3.5 + vLLM + veRL 的 fully-async 架构
- MoE 训练加速实战:DeepEP + Grouped GeMM + Aux-Loss-Free 的 Qwen3.5 配方
- Qwen3-8B 下让 Gradient Checkpointing 收益最大化:选择性重算 + Pareto 曲线
- Qwen3-8B 下 CUDA Graph 的合理使用:训练 / 推理分场景 + 陷阱清单
- 训推加速 Qwen3 实战:从"调包"到手写 Triton Kernel(含 backward)
- 训推加速 Qwen3 实战:看懂模型结构 + 识别算子融合机会
- Design Spec — 训推加速系列:看懂 Qwen3 + Fusion 识别 + Triton 实战