模型架构 12
- up_proj 和 gated_proj 共享权重减 50% FFN 参数: 16 个验证集全部退化的干净失败
- Embedding 占了模型 10% 参数却只做查表:从 tie-embeddings=yes 到 PLE 的工程演化
- KV Cache 砍 90%、推理提速 7x:六个正交架构创新如何叠加生效
- SWA + Gated Attention loss 降了 0.013:从一个 3B 模型实验看 Attention 演化的工程选择
- SwiftKV 预测 12 层 loss 最低, 但最终选了 16 层: 端侧首词提速 35% 的工程决策
- Partial MoE Scaling Law: 后16层换MoE、1/8激活比丢了17-19%性能的真实代价
- 512 Expert 里 80% 是死的:从 MuonClip 到 Expert Upcycling,MoE 训练稳定性的三个生死问题
- CoLA 说参数减 45% 不掉点,我们的 3B 实验说 6.85T tokens 才能追平:一个精确的负面结果
- CoLA 放在 up_proj 收敛快 2.3 倍: FFN 内部低秩最优落点的定位实验
- 五次排除实验定位 Attention 门控最优解:Sink 无效、RoPE 反噬、小窗口翻车
- 新架构 34/35 验证集更好、ceval +2.67 pt, 但 iter-time 慢了 3.17 倍: 结构升级的效率代价决策
- 5 个独立创新逐步叠加, 从 loss 1.966 到 1.882 追平 Qwen3-4B: 架构集成的工程叙事