DMD → DMD2:扩散模型一步蒸馏,从分布匹配到超越教师
多步扩散模型采样成本高昂——Stable Diffusion 需要 50 步,EDM 需要 511 步。将多步扩散模型蒸馏为单步生成器能实现 500 倍推理加速(0.09s 一张 512×512 图像),但核心挑战在于:一步生成如何匹配多步采样的质量?
MIT 与 Adobe 的团队在两个连续工作中逐步攻克了这个难题:先以分布匹配 + 回归损失奠定基础(DMD, 2023.11),再以 TTUR + GAN 损失 + 后向模拟突破教师质量上限(DMD2, 2024.05)。这也是少有的”同一团队把蒸馏方法从奠基做到反超教师”的完整演进案例。
分布匹配蒸馏(DMD,2023.11)
DMD 的核心思路是”分布级匹配 + 样本级回归”的双轨策略。
分布匹配:最小化生成分布与真实分布之间的 KL 散度。其梯度可表示为两个分数函数之差——一个来自固定在真实数据上的教师扩散模型,另一个来自动态学习生成数据分布的假分数模型。这使得 DMD 不同于逐样本回归的蒸馏方法,能在分布层面感知”真实感”的方向。
回归损失:分布匹配梯度本身不足以稳定训练,DMD 额外维护一个预计算的噪声-图像配对数据集(来自教师模型的 ODE 确定性采样),用 LPIPS 距离约束生成器输出——相当于给分布匹配加了一个”锚”。
Figure 2. 方法总览。单步生成器 Gθ 将随机噪声映射为图像。预计算噪声-图像配对通过 LPIPS 回归损失约束生成器,分布匹配梯度(双分数函数之差)提供真实感增强方向。
结果:ImageNet-64×64 上 FID 2.62(单步),逼近教师 EDM 的 2.32(511 步);COCO 零样本 FID 11.49(vs 教师 8.78)。但回归损失存在两个问题:一是配对数据集构建成本高昂(SDXL 需 700 A100 天),二是将学生”绑定”在教师的采样路径上,导致质量上限受限于教师。
改进版蒸馏(DMD2,2024.05)
DMD2 对 DMD 做了三处关键改进:
1. 移除回归损失 + TTUR:移除回归损失后训练立即不稳定——生成图像的亮度等统计量剧烈波动。DMD2 发现根源在于假分数模型在非平稳分布上训练。解决方案:双时间尺度更新规则(TTUR),每 1 次生成器更新搭配 5 次假分数模型更新。这完全恢复了稳定性,且 FID 从 3.48 回到 2.61(匹配 DMD 基线)。
2. GAN 损失:在假分数模型瓶颈层叠加分类分支,判别器区分真实图像与生成图像。这纠正了教师分数函数的近似误差,使学生能借助真实数据监督超越教师。
3. 后向模拟:多步蒸馏时,训练阶段用真实图像加噪,推理阶段用上一生成器步的输出加噪,造成输入不匹配。DMD2 的方案是训练时直接用生成器当前输出加噪,彻底消除 mismatch。
Figure 3. DMD2 方法。训练交替进行:1) 优化生成器(分布匹配梯度 + GAN 损失),2) 训练假分数模型和判别器。学生可以是单步或多步模型,后向模拟消除了多步训练-推理输入不匹配。
关键结果
DMD2 在三个设定上均取得突破:
| 设定 | 指标 | DMD2 | 教师 | 加速比 |
|---|---|---|---|---|
| ImageNet-64×64 | FID | 1.28 | 2.32 (EDM, 511 步) | 500× |
| COCO 零样本 (SD v1.5) | FID | 8.35 | 8.59 (50 步 ODE) | 50× |
| COCO 零样本 (SDXL) | FID | 19.32 (4 步) | 19.36 (100 步) | 25× |
ImageNet-64×64 上 1.28 FID 不仅超越了教师 EDM 的 2.32,还超越了 StyleGAN-XL 的 1.52。COCO 零样本 8.35 FID 首次实现一步蒸馏模型反超教师 SD v1.5。SDXL 4 步模型在 FID 上匹配 100 步教师,仅需 1/25 的计算量。
用户研究进一步确认了这些指标的实际意义:
Figure 5. 用户研究。4 步蒸馏模型 vs 教师(50 步)+ 竞争基线。DMD2 在图像质量和提示对齐两个维度均获得最高偏好率。
消融:每项改进的独立贡献
DMD2 的消融分析清晰揭示了演进路径:
- DMD 完整 → FID 2.62
- 移除回归损失 → 3.48(退步,训练不稳定)
- + TTUR(5:1 假分数更新) → 2.61(恢复 DMD 基线)
- + GAN 损失(DMD2 完整) → 1.51(大幅超越)
SDXL 4 步消融同样明确:GAN 损失贡献最大(移除后 FID 从 19.32 升至 26.90),分布匹配保证文本对齐(移除后 CLIP 从 0.332 降至 0.307),后向模拟有小幅但稳定的提升(19.32 → 20.66)。
核心洞察
- 分布匹配 > 样本匹配:KL 散度梯度(分数函数差)比配对回归损失更灵活,质量上限更高。
- TTUR 是回归损失的完美替代:5:1 的假分数更新频率完全弥补了回归损失消失带来的稳定性问题,不引入额外成本。
- GAN 损失提供外部监督:真实数据判别器纠正了教师分数函数的近似误差,这是学生能超越教师的关键。
- 后向模拟解决多步蒸馏核心瓶颈:训练-推理输入不匹配是多步蒸馏的致命问题,解决方案简单且高效。
- 昂贵配对数据集非必需:DMD2 证明无需预先生成噪声-图像配对(SDXL 节约 700 A100 天)即可达到甚至超越 SOTA 蒸馏质量。
Caveats
- DMD 未开源;DMD2 已开源(代码 + 预训练模型均可复现)
- DMD2 仍有轻微多样性退化(diversity score 0.61 vs 教师 0.64)
- 4 步模型对 SDXL 仍是必需,单步 SDXL FID 19.01 尚未完全匹配教师
- CFG 尺度在训练时固定,限制了用户推理时的灵活性
参考
- DMD:arXiv:2311.18828 — Distribution Matching Distillation
- DMD2:arXiv:2405.14867 — Improved Distribution Matching Distillation
- 团队项目页:https://tianweiy.github.io/dmd2/