Qian, Cheng

DMD → DMD2:扩散模型一步蒸馏,从分布匹配到超越教师

多步扩散模型采样成本高昂——Stable Diffusion 需要 50 步,EDM 需要 511 步。将多步扩散模型蒸馏为单步生成器能实现 500 倍推理加速(0.09s 一张 512×512 图像),但核心挑战在于:一步生成如何匹配多步采样的质量? MIT 与 Adobe 的团队在两个连续工作中逐步攻克了这个难题:先以分布匹配 + 回归损失奠定基础(DMD, 2023.11),再以 T...

KL 散度、Cosine、Sim:大模型训练里的“相近”到底怎么量?一个数值实验告诉你它们有多不同

做 LLM 训练,几乎每天都要和”相近”打交道:蒸馏要让学生分布接近教师分布,RLHF 要约束新策略不能偏离旧策略太远,表征分析要比较不同层的 hidden state 像不像。但”相近”这个模糊的词,落到具体指标上却是完全不同的数学结构——KL 散度是信息论,Cosine 是几何,MSE 是代数。它们对同一份数据的回答可能完全相反,而训练结果就取决于你选对了哪一个。 这篇文章不只是罗列定...

arXiv 论文分诊方法论:如何用 6 个维度 30 秒筛出一篇值得精读的论文

如果你在 LLM 算法/系统方向做研究,arXiv 每天新论文的数量已经多到不可能全读。但现有的筛选方式都存在问题:只看引用数对太新的论文无效,只看标题摘要会漏掉真正有工程价值的贡献,而精读一篇不相关的论文要浪费 2-3 小时。 我整理了一套适合 LLM 算法/工程方向的论文分诊(triage)方法论,核心思路是 “减法优先,加权打分”。 为什么要造一套自己的方法论? 现有的论文筛选工...

Visual PLE 五种方法全军覆没:NTP-only 范式下自监督闭环缺失的完整诊断

Text PLE 给某 3B 多模态模型带来了 loss -0.023 的显著收益,仅增加 +883M 参数(dP=256)。我们自然想把同样的思路用到视觉 token 上。结果:5 种方法全军覆没,NTP loss 变化全在千分位级别。cos_sim 诊断显示 embedding 结构和随机初始化无异。这篇文章是对这次失败的完整诊断。 1. PLE 机制回顾:为什么 Text PLE...

SAM in Annealing: Loss Landscape Geometry Determines Quantization Robustness

某 1B 模型做 4-bit 量化后精度掉了一截。调了各种量化方案都不管用。最后发现问题出在预训练阶段——换了一下退火阶段的优化器(仅最后 10% 步数),4-bit 量化退化直接减少了 40%。原因是 loss landscape 的几何形状比 loss 值本身更重要。 1. 低 Loss 不等于好部署 预训练的优化目标是最小化 loss。所有人默认:loss 越低 → base ...

MoE 做 RL 训练时 Routing 决策飘了:一个零成本的 Replay 方案消除了精度不一致

某 309B MoE 模型做 Agentic RL 训练,reward 上升但比预期慢 30%。排查发现一个隐蔽问题:rollout 阶段(FP8)和梯度更新阶段(BF16)对同一个 token 选择了不同的 expert——MoE 的离散路由决策让浮点精度差异变成了路径分歧。修复只需 50 行代码:记录 rollout 时的路由索引,训练时直接重放。 1. RL 训练的两阶段结构 ...

Format Switch 的收益是 Ratio 调整的 8-60 倍: daVinci-LLM 200 次消融揭示的预训练数据工程三大定律

某 3B 模型(从零训练 8T tokens)整体 51.72 分与 7B 参数的 OLMo-3 打平。关键不是用了更多数据——而是 200 次消融发现的三条定律:处理深度是与数据量并列的 scaling 维度,格式切换的收益是比例调整的 8-60 倍,不同能力域的饱和速率可以差 4 倍以上。 1. 预训练数据工程为何被严重低估 Scaling law 文献集中在参数量与 token...

RMSNorm 后的 Layer Scalar 漂移到 56 但训练 Loss 纹丝不动:一个 Adam 优化器的隐形 Bug

某 3B 模型训练到 Stage2 结束,例行检查参数分布时发现最后一层的 learnable scalar 从初始 1.0 漂移到了 56.25。但训练 loss 和所有评测指标完全没有任何异常。这个参数在”假装学习”——而且会在端侧 INT4 量化时致命。 这篇文章记录完整的排查过程:从发现现象、定位根因、理解数学原理,到三次修复尝试(两次失败),最终给出一个三文件改动的干净解。 ...