architecture 21
- up_proj 和 gated_proj 共享权重减 50% FFN 参数: 16 个验证集全部退化的干净失败
- Embedding 占了模型 10% 参数却只做查表:从 tie-embeddings=yes 到 PLE 的工程演化
- SwiftKV — KV Cache 跨层预测从预训练到 RL 的完整工程叙事
- SWA + Gated Attention — Loss 降了 0.013 但窗口越小评测越差的反直觉实验
- Sample Packing + Attention Masking:未定义变量减少 52.7% 的预训练工程细节
- KV Cache 砍 90%、推理提速 7x:六个正交架构创新如何叠加生效
- KV Cache 共享让文本榜单掉了 1.9%,但 RL 四轮迭代后反超 baseline 1.4%: 架构退化的 RL 补偿机制
- SwiftKV 预测 12 层 loss 最低, 但最终选了 16 层: 端侧首词提速 35% 的工程决策
- PLE 参数扩展的死区现象:为什么 dP=64→128 完全不降 loss
- Partial MoE Scaling Law: 后16层换MoE、1/8激活比丢了17-19%性能的真实代价
- 同样的数据重复 20 遍不过拟合?数据配比中那些反直觉的 Scaling Law
- CoLA 说参数减 45% 不掉点,我们的 3B 实验说 6.85T tokens 才能追平:一个精确的负面结果
- CoLA 放在 up_proj 收敛快 2.3 倍: FFN 内部低秩最优落点的定位实验
- Attention Residual 拿了 0.025 的 loss 收益, 但 PyTorch 实现慢了 90%: Triton Kernel 怎么把开销压到 14%
- Layer Scalar 不加 Weight Decay 漂到 56, 为什么 Bias 不加却安然无恙: 一个用具体数字说明的数学推导
- 五次排除实验定位 Attention 门控最优解:Sink 无效、RoPE 反噬、小窗口翻车
- 新架构 34/35 验证集更好、ceval +2.67 pt, 但 iter-time 慢了 3.17 倍: 结构升级的效率代价决策
- 5 个独立创新逐步叠加, 从 loss 1.966 到 1.882 追平 Qwen3-4B: 架构集成的工程叙事
- MoE 教师 → Dense 学生:2024~2026 开源社区的落地范式
- Transformer 前向流程与自注意力机制简述
- 深度学习中的矩阵运算与线性代数基础