性能优化 20
- 水印消除 / 图像编辑模型训练加速:Inpainting / Instruct-Edit / Flux Fill 的 2024~2026 栈
- 视频 & 3D 扩散训推加速:Wan 2.2 / HunyuanVideo / VSA / Gaussian Splatting
- 训推加速效率指标全景:吞吐 / 延迟 / MFU / TGS / SLO(含数学公式)
- 训推加速技术地图:三维分类 + 全景图 + 决策流 + 大模型加速术语表
- 语音 / 音频模型加速新常识:从 Audio Tokenizer 到 Full-duplex 对话
- Speculative Decoding 实战:vLLM 框架下 EAGLE-3 原理与工程落地
- 视频图像分割模型技术洞察与训练加速:SAM 2 / SAM 3 / Grounded-SAM / 视频 Mask 的 2024~2026 栈
- 机器人 VLA 训推加速:OpenVLA / π0 / RDT-1B / GR00T 的实时控制工程
- RL 训练加速实战:Qwen3.5 + vLLM + veRL 的 fully-async 架构
- 音乐生成加速:Suno / MusicLM / UniAudio / Stable Audio
- MoE 训练加速实战:DeepEP + Grouped GeMM + Aux-Loss-Free 的 Qwen3.5 配方
- 图像 Diffusion 训推加速深化:FLUX / SD3 / DMD2 / SageAttention
- Qwen3-8B 下让 Gradient Checkpointing 收益最大化:选择性重算 + Pareto 曲线
- 替换 Fused Kernel 后如何对齐训推精度:7 类差异来源 + 3 道验证 Gate + 8 个实战技巧
- 端侧多模态端到端加速:MiniCPM-o / Gemma 3n / Qwen3-Omni
- Qwen3-8B 下 CUDA Graph 的合理使用:训练 / 推理分场景 + 陷阱清单
- 训推加速 Qwen3 实战:从"调包"到手写 Triton Kernel(含 backward)
- 训推加速问题定位 SOP 与 Know-how:从 GPU 低利用率到 NCCL hang 到推理吞吐
- 训推加速 Qwen3 实战:看懂模型结构 + 识别算子融合机会
- 训推加速 Python 侧排障 SOP:OOM / GIL / asyncio / DataLoader / IO