Qian, Cheng

训推加速效率指标全景:吞吐 / 延迟 / MFU / TGS / SLO(含数学公式)

本系列前面 8 篇讲”怎么加速”——但团队协作时经常发现每个人说的”快”都不是一回事:训练组说 tokens/sec,推理组说 TTFT,infra 说 MFU。这篇把训推加速里所有高价值指标一次摆清楚,每个都给数学公式 + Qwen3-8B 示意数字。 姊妹篇:训推加速系列导航(在做) · GPU/NCCL SOP · Python CPU SOP 零、本文骨架 ...

视频图像分割模型技术洞察与训练加速:SAM 2 / SAM 3 / Grounded-SAM / 视频 Mask 的 2024~2026 栈

训推加速系列深化之”视觉分割”专题。2024 SAM 2 把”可提示分割”从图像扩到视频,2025~2026 Grounded-SAM / Florence-2 / SAM 3 进一步把分割和开放词汇检测 / VLM 打通。这一篇讲清 分割任务的独有加速挑战(Mask Head / Memory Attention / 视频一致性)和训练端的工程套路。 姊妹篇:训推加速技术地图 · 图...

机器人 VLA 训推加速:OpenVLA / π0 / RDT-1B / GR00T 的实时控制工程

训推加速系列深化之”机器人 VLA”专题。Vision-Language-Action(VLA)模型是 2024~2026 机器人领域最大范式变化——把 VLM backbone 接上 action head,输出关节 / 末端控制。和对话 LLM 不同,VLA 的加速核心目标不是吞吐而是控制频率(20~50 Hz) 和 sim-to-real 一致性。 姊妹篇:训推加速技术地图 · ...

音乐生成加速:Suno / MusicLM / UniAudio / Stable Audio

训推加速系列深化之”音乐生成”专题。音乐生成是个独立于 TTS 的生成方向——多轨 / 长序列 / 高保真 / 风格多样是它独有的挑战。本篇拆解 2024~2026 的两大范式(Audio Token AR vs Latent Diffusion)、加速专项、主流系统。 姊妹篇:训推加速技术地图 · 语音 / 音频加速(补前置概念) ⚠️ 时效声明(最后更新:2026-05-08...