Post

DMD → DMD2:扩散模型一步蒸馏,从分布匹配到超越教师

DMD → DMD2:扩散模型一步蒸馏,从分布匹配到超越教师

多步扩散模型采样成本高昂——Stable Diffusion 需要 50 步,EDM 需要 511 步。将多步扩散模型蒸馏为单步生成器能实现 500 倍推理加速(0.09s 一张 512×512 图像),但核心挑战在于:一步生成如何匹配多步采样的质量?

MIT 与 Adobe 的团队在两个连续工作中逐步攻克了这个难题:先以分布匹配 + 回归损失奠定基础(DMD, 2023.11),再以 TTUR + GAN 损失 + 后向模拟突破教师质量上限(DMD2, 2024.05)。这也是少有的”同一团队把蒸馏方法从奠基做到反超教师”的完整演进案例。

分布匹配蒸馏(DMD,2023.11)

DMD 的核心思路是”分布级匹配 + 样本级回归”的双轨策略。

分布匹配:最小化生成分布与真实分布之间的 KL 散度。其梯度可表示为两个分数函数之差——一个来自固定在真实数据上的教师扩散模型,另一个来自动态学习生成数据分布的假分数模型。这使得 DMD 不同于逐样本回归的蒸馏方法,能在分布层面感知”真实感”的方向。

回归损失:分布匹配梯度本身不足以稳定训练,DMD 额外维护一个预计算的噪声-图像配对数据集(来自教师模型的 ODE 确定性采样),用 LPIPS 距离约束生成器输出——相当于给分布匹配加了一个”锚”。

DMD 方法总览:双分数函数 + 回归损失 Figure 2. 方法总览。单步生成器 Gθ 将随机噪声映射为图像。预计算噪声-图像配对通过 LPIPS 回归损失约束生成器,分布匹配梯度(双分数函数之差)提供真实感增强方向。

结果:ImageNet-64×64 上 FID 2.62(单步),逼近教师 EDM 的 2.32(511 步);COCO 零样本 FID 11.49(vs 教师 8.78)。但回归损失存在两个问题:一是配对数据集构建成本高昂(SDXL 需 700 A100 天),二是将学生”绑定”在教师的采样路径上,导致质量上限受限于教师。

改进版蒸馏(DMD2,2024.05)

DMD2 对 DMD 做了三处关键改进:

1. 移除回归损失 + TTUR:移除回归损失后训练立即不稳定——生成图像的亮度等统计量剧烈波动。DMD2 发现根源在于假分数模型在非平稳分布上训练。解决方案:双时间尺度更新规则(TTUR),每 1 次生成器更新搭配 5 次假分数模型更新。这完全恢复了稳定性,且 FID 从 3.48 回到 2.61(匹配 DMD 基线)。

2. GAN 损失:在假分数模型瓶颈层叠加分类分支,判别器区分真实图像与生成图像。这纠正了教师分数函数的近似误差,使学生能借助真实数据监督超越教师。

3. 后向模拟:多步蒸馏时,训练阶段用真实图像加噪,推理阶段用上一生成器步的输出加噪,造成输入不匹配。DMD2 的方案是训练时直接用生成器当前输出加噪,彻底消除 mismatch。

DMD2 方法总览:GAN 损失 + 分布匹配 + 双分数函数 Figure 3. DMD2 方法。训练交替进行:1) 优化生成器(分布匹配梯度 + GAN 损失),2) 训练假分数模型和判别器。学生可以是单步或多步模型,后向模拟消除了多步训练-推理输入不匹配。

关键结果

DMD2 在三个设定上均取得突破:

设定指标DMD2教师加速比
ImageNet-64×64FID1.282.32 (EDM, 511 步)500×
COCO 零样本 (SD v1.5)FID8.358.59 (50 步 ODE)50×
COCO 零样本 (SDXL)FID19.32 (4 步)19.36 (100 步)25×

ImageNet-64×64 上 1.28 FID 不仅超越了教师 EDM 的 2.32,还超越了 StyleGAN-XL 的 1.52。COCO 零样本 8.35 FID 首次实现一步蒸馏模型反超教师 SD v1.5。SDXL 4 步模型在 FID 上匹配 100 步教师,仅需 1/25 的计算量。

用户研究进一步确认了这些指标的实际意义:

DMD2 用户研究:图像质量与提示对齐偏好 Figure 5. 用户研究。4 步蒸馏模型 vs 教师(50 步)+ 竞争基线。DMD2 在图像质量和提示对齐两个维度均获得最高偏好率。

消融:每项改进的独立贡献

DMD2 的消融分析清晰揭示了演进路径:

  • DMD 完整 → FID 2.62
  • 移除回归损失 → 3.48(退步,训练不稳定)
  • + TTUR(5:1 假分数更新) → 2.61(恢复 DMD 基线)
  • + GAN 损失(DMD2 完整)1.51(大幅超越)

SDXL 4 步消融同样明确:GAN 损失贡献最大(移除后 FID 从 19.32 升至 26.90),分布匹配保证文本对齐(移除后 CLIP 从 0.332 降至 0.307),后向模拟有小幅但稳定的提升(19.32 → 20.66)。

核心洞察

  1. 分布匹配 > 样本匹配:KL 散度梯度(分数函数差)比配对回归损失更灵活,质量上限更高。
  2. TTUR 是回归损失的完美替代:5:1 的假分数更新频率完全弥补了回归损失消失带来的稳定性问题,不引入额外成本。
  3. GAN 损失提供外部监督:真实数据判别器纠正了教师分数函数的近似误差,这是学生能超越教师的关键。
  4. 后向模拟解决多步蒸馏核心瓶颈:训练-推理输入不匹配是多步蒸馏的致命问题,解决方案简单且高效。
  5. 昂贵配对数据集非必需:DMD2 证明无需预先生成噪声-图像配对(SDXL 节约 700 A100 天)即可达到甚至超越 SOTA 蒸馏质量。

Caveats

  • DMD 未开源;DMD2 已开源(代码 + 预训练模型均可复现)
  • DMD2 仍有轻微多样性退化(diversity score 0.61 vs 教师 0.64)
  • 4 步模型对 SDXL 仍是必需,单步 SDXL FID 19.01 尚未完全匹配教师
  • CFG 尺度在训练时固定,限制了用户推理时的灵活性

参考

  • DMD:arXiv:2311.18828 — Distribution Matching Distillation
  • DMD2:arXiv:2405.14867 — Improved Distribution Matching Distillation
  • 团队项目页:https://tianweiy.github.io/dmd2/
This post is licensed under CC BY 4.0 by the author.