scaling-law 8
- Format Switch 的收益是 Ratio 调整的 8-60 倍: daVinci-LLM 200 次消融揭示的预训练数据工程三大定律
- Partial MoE Scaling Law: 后16层换MoE、1/8激活比丢了17-19%性能的真实代价
- 目标数据重复 15-20 遍不过拟合:混合训练的 Scaling Law 推翻了'4 epoch 定律'
- 上线才发现的坑:Token Budget 设计、Function Calling 格式战争与 Proxy Metric 翻车
- 同样的数据重复 20 遍不过拟合?数据配比中那些反直觉的 Scaling Law
- 7B 模型重复 8 次只保留 25% 有效信息, 400M 保留 50%: 大模型比小模型对数据重复更敏感
- CoLA 说参数减 45% 不掉点,我们的 3B 实验说 6.85T tokens 才能追平:一个精确的负面结果
- 5 个独立创新逐步叠加, 从 loss 1.966 到 1.882 追平 Qwen3-4B: 架构集成的工程叙事