Qian, Cheng

PLE 参数扩展的死区现象:为什么 dP=64→128 完全不降 loss

开场:一个反直觉的实验结果 PLE 从 dP=64 扩到 dP=128,参数多花了 220M,loss 一丝不动——2.149→2.149。而从 128 跳到 256,突然降了 0.017。 这不是噪声。多次复现,结果稳定。某 3B 模型的 PLE scaling 曲线上,存在一个清晰的”死区”(dead zone):参数加了,但模型完全无感。这迫使我们重新审视一个假设——参数量与 lo...

Partial MoE Scaling Law: 后16层换MoE、1/8激活比丢了17-19%性能的真实代价

某 4B Dense 模型想要推理加速——把后 16 层 FFN 换成 MoE。Scaling Law 估算的结论出人意料:1/8 激活比直接丢了 17-19% 性能(判死刑),即使 1/2 激活也要把总参数从 4B 扩到 5.2B(+28-33%)才能追平。这笔账到底该怎么算? 为什么只换”后半段”? 这个 4B Dense 模型的架构是 32 层、H=2560,但 FFN 维度并不均...

不写一行代码,用 AI Agent 10 分钟搭建你的私人搜索引擎

这篇文章给谁看 你是产品经理、运营、分析师——不会写代码,但: 你有一个 AI 编程助手(Claude Code / Cursor / Windsurf / Codex,任何一个都行) 你有一台境外云服务器(没有的话,AI 也能帮你买) 你想拥有一个完全属于自己的、无广告、无追踪、带 API 的搜索引擎 你要做的事只有两件:复制一段 Prompt 给 AI → 打开浏览...

Router 梯度和 Expert 梯度分开裁剪, Loss Spike 频率降了 80%: MoE 训练稳定性的优化器视角

某 1T 参数 MoE 模型训练中 loss spike 频繁出现。换了优化器之后,spike 频率直降 80%。核心 insight 极其简单:Router 梯度和 Expert 梯度的统计特性完全不同,不应该用同一个裁剪阈值。 这篇文章从优化器视角分析 MoE 训练不稳定性的根源,以及 MuonClip 如何通过三个针对性设计解决这个问题。 MoE 训练的三重不稳定性 MoE ...

目标数据重复 15-20 遍不过拟合:混合训练的 Scaling Law 推翻了'4 epoch 定律'

通用 Scaling Law 说目标数据重复超过 4 轮就开始退化。我们在混合训练中发现完全不是这回事——目标数据可以重复 15-20 轮而不退化,前提是有通用数据持续注入”新鲜梯度”。这个发现来自 2000+ 次训练实验的 power-law 拟合。 “4-epoch 定律”以及它在混合训练中为什么不成立 2023 年的经典结论(Muennighoff et al.)清晰且简单:单一...

4K→1M 上下文扩展只用了 2000 步:三份真实长文训练配置的工程复盘

复盘:128K Eval 上 PPL 突然爆炸的定位过程 某 671B MoE 模型完成 14.8T tokens 主预训练后,第一次把序列长度从 4K 推到 32K 做 eval——PPL 从 7.2 飙到 142。位置编码完全没见过 >4K 的位置,外推失败是意料之中的。 工程团队的方案是 YaRN 扩展。但 YaRN 有几十个超参要配:scale、alpha、beta、tar...

训练 Loss 不动但模型已坏?Adam 漂移、Softmax 饱和、梯度稀释三大隐形杀手

大模型训练中,很多”诡异现象”其实都有干净的数学解释。本文分享三个我在实际训练中踩过的坑,每个都涉及一个容易被忽视的底层机制。它们的共同特点是:training loss 看起来完全正常,但模型已经在某个维度上悄悄劣化了。 1. Adam 优化器在零梯度参数上的单调漂移 现象 某 3B 模型训练结束后做 INT8 量化,发现最后一层 RMSNorm 的 learnable scal...

上线才发现的坑:Token Budget 设计、Function Calling 格式战争与 Proxy Metric 翻车

做 LLM 工程和做传统后端最大的区别在于:很多坑不会以 error 的形式出现,而是以”指标莫名下降 2 个点”的形式出现。 这篇文章汇总了我在生产环境中踩过的几类隐性陷阱,希望能帮你少走弯路。 1. Token Budget 是分类问题不是回归问题 很多人第一次设计 thinking budget 机制时,会本能地把它当作连续值回归 — 让模型自己决定”我要思考多少 token”...