Design Spec — 训推加速系列深化 9 篇(2026-05-08)
本篇基于 训推加速技术地图 post 的各行展开深化。 0. 共享约定(所有 9 篇通用) Standing example:能用 Qwen3.5 / 3.6 / DeepSeek-V4 等 2025-2026 SOTA 举例 HF pastel mermaid(与姊妹篇视觉一致):黄 / 蓝 / 绿 / 粉四色 图文规范:每张  后加两个空格换行再写图注;...
本篇基于 训推加速技术地图 post 的各行展开深化。 0. 共享约定(所有 9 篇通用) Standing example:能用 Qwen3.5 / 3.6 / DeepSeek-V4 等 2025-2026 SOTA 举例 HF pastel mermaid(与姊妹篇视觉一致):黄 / 蓝 / 绿 / 粉四色 图文规范:每张  后加两个空格换行再写图注;...
本系列前面 8 篇讲”怎么加速”——但团队协作时经常发现每个人说的”快”都不是一回事:训练组说 tokens/sec,推理组说 TTFT,infra 说 MFU。这篇把训推加速里所有高价值指标一次摆清楚,每个都给数学公式 + Qwen3-8B 示意数字。 姊妹篇:训推加速系列导航(在做) · GPU/NCCL SOP · Python CPU SOP 零、本文骨架 ...
系列前面 10 篇每篇聚焦一个具体技术。这篇从全局视角把它们放在同一张地图上——按阶段 / 瓶颈 / 触达层三维分类,给决策流,最后附 60+ 条大模型训推加速术语表。新人入场看完这篇再决定深挖哪个子方向。 零、本文骨架 小节 主题 产出 §一 引子:技术栈太多,从哪看起 ...
背景 手上有一台闲置的境外云厂商 VPS (Ubuntu 24.04),希望: 把它接入自己的 Tailscale tailnet 作为 exit node 让手机(Android)走这台 VPS 出口访问海外流媒体(以 YouTube 为例) 自定义 WireGuard UDP 端口(>1024 的随机端口,避开常见扫描特征) 防火墙/内核转发规范配置,避免装完...
本文是训推加速系列里第一篇专门讲语音 / 音频的 post。系列前面的篇讲的都是 LLM、Diffusion、MoE——这篇聚焦语音栈独有的加速技术:Audio Tokenizer / AuT / K2 / Zipformer / Flow Matching TTS / Mimi codec / HiFi-GAN / Full-duplex 对话。 姊妹篇:训推加速技术地图(全局视角 ...
训推加速系列深化之”解码优化专题”。以 vLLM 框架为基础,拆解 EAGLE-3 的原理、数据流、训练 / 推理实战。Speculative Decoding 是 2023~2026 解码加速最重要的一条路线,EAGLE-3 又是这条路线的 2025 SOTA。 姊妹篇:训推加速技术地图 · 效率指标全景(TPOT / Goodput 定义)· CUDA Graph 实战 ⚠️...
训推加速系列深化之”视觉分割”专题。2024 SAM 2 把”可提示分割”从图像扩到视频,2025~2026 Grounded-SAM / Florence-2 / SAM 3 进一步把分割和开放词汇检测 / VLM 打通。这一篇讲清 分割任务的独有加速挑战(Mask Head / Memory Attention / 视频一致性)和训练端的工程套路。 姊妹篇:训推加速技术地图 · 图...
训推加速系列深化之”机器人 VLA”专题。Vision-Language-Action(VLA)模型是 2024~2026 机器人领域最大范式变化——把 VLM backbone 接上 action head,输出关节 / 末端控制。和对话 LLM 不同,VLA 的加速核心目标不是吞吐而是控制频率(20~50 Hz) 和 sim-to-real 一致性。 姊妹篇:训推加速技术地图 · ...
训推加速系列深化之”RL 训练”专题。2024~2026 o1 系 reasoning 模型火爆后,大规模 RL post-training 成为所有头部实验室的必修课。本篇以 Qwen3.5 + vLLM + veRL 为 standing example,讲清 RL 训练的瓶颈、fully-async 架构、GRPO / DAPO / GSPO 等算法、工程陷阱。 姊妹篇:训推加速...
训推加速系列深化之”音乐生成”专题。音乐生成是个独立于 TTS 的生成方向——多轨 / 长序列 / 高保真 / 风格多样是它独有的挑战。本篇拆解 2024~2026 的两大范式(Audio Token AR vs Latent Diffusion)、加速专项、主流系统。 姊妹篇:训推加速技术地图 · 语音 / 音频加速(补前置概念) ⚠️ 时效声明(最后更新:2026-05-08...
训推加速系列深化之”MoE 训练加速”专题。2024~2026 开源 SOTA 基本都走 MoE 路线(DeepSeek-V3 / Qwen3-MoE / Mixtral / GPT-OSS),但 MoE 训练的通信瓶颈 / 负载均衡 / 路由数值是三大独立痛点。本篇以 Qwen3.5 / Qwen3.6 MoE 级别的训练为 standing example,拆解从 DeepEP 到 Au...
训推加速系列深化之”MoE → Dense 蒸馏”专题。2024~2026 开源社区最成功的一条落地路线——先用巨大 MoE 预训练到 SOTA,再蒸馏成消费级 Dense 模型。代表作:Qwen3-MoE → Qwen3-Dense / Gemma-Large → Gemma-3n / DeepSeek-V3 → DeepSeek-R1-Distill 系列。 姊妹篇:训推加速技术地...