同样的数据重复 20 遍不过拟合?数据配比中那些反直觉的 Scaling Law
大模型训练中,数据工程的决策往往比模型架构更影响最终效果。本文从四个维度系统梳理数据配比、重复、多样性与质量的量化决策框架,提供可直接落地的方法论。 1. 通用数据是稀有领域重复的隐式正则化 在实际项目中,目标领域数据(如医疗、法律、代码)往往远少于通用语料。2026 年一项关于混合训练的 Scaling Law 研究揭示了一个关键机制:通用数据的持续注入本质上是对稀缺领域重复的隐式...
大模型训练中,数据工程的决策往往比模型架构更影响最终效果。本文从四个维度系统梳理数据配比、重复、多样性与质量的量化决策框架,提供可直接落地的方法论。 1. 通用数据是稀有领域重复的隐式正则化 在实际项目中,目标领域数据(如医疗、法律、代码)往往远少于通用语料。2026 年一项关于混合训练的 Scaling Law 研究揭示了一个关键机制:通用数据的持续注入本质上是对稀缺领域重复的隐式...
7B 模型把训练数据重复 8 次,有效信息只剩 25%。同样的数据重复 8 次给 400M 模型,保留 50%。大模型比小模型对重复更敏感——这颠覆了”大模型能从数据中学到更多”的直觉。 InfoLaw 提出了一个统一的信息论框架,量化了数据重复、数据质量和模型规模三者之间的交互关系。核心发现:repetition decay 不是常数,而是模型规模的递增函数。模型越大,重复数据的边际信息...
开场:30 条数据的奇迹 先看一组让人不太敢信的实验数据: 模型 规模 方法 Stage AIME24 AIME25 AMC23 MATH500 Avg Base (R1-Distill) 1.5B ...
CoLA 论文声称参数减 45% 不掉点。我们在某 3B 模型的 FFN 上实测:全低秩方案(r=640) 训了 158B token,loss 差 0.18 当场判死刑。单点低秩(up_proj, r=1280) 好得多——但 power-law 外推说 6.85T tokens 才能追平 baseline。这比我们的训练预算大了 3.8 倍。 这篇文章记录一个完整的负面结果。不是”方法...
CoLA 论文说低秩化能减 45% 参数不掉点。我们在某 3B 模型上验证:放在 down_proj 收敛比放在 up_proj 慢 2.3 倍,放在全部三个投影直接崩了(+0.17 loss)。FFN 内部不是哪里都能做低秩的——up_proj 是唯一可行的落点。 SwiGLU FFN 结构与三个可选落点 某 3B 模型的 FFN 采用 SwiGLU 结构: output = dow...
某 3B 模型架构搜索中,Block Attention Residual 带来了 0.025 的 loss 收益——不加任何参数。但 PyTorch 实现直接慢了 90%,整个训练周期要翻倍。Triton kernel 迭代两版后把开销压到 14%,让这个”免费”的收益真正能用上。 这个 case 的核心教训:研究上有效的结构创新,离工程落地往往差一个 kernel 的距离。 Bloc...
某 3B 模型的 Layer Scalar 不加 weight decay 漂到了 56.25(详见上篇)。顺理成章的追问:bias 也不加 weight decay,它为什么不漂?答案藏在一个简单的数学性质里——bias 对所有样本加相同常数,帮了一部分就必然害另一部分。这形成了天然的有限平衡点。 1. 行业标准:所有主流框架都把 bias 排除在 weight decay 之外 ...
开场:一个 3B 模型的 Attention 选型决策 某 3B 端侧模型的架构选型阶段,团队在 Attention 机制上做了 5 轮排除实验。最终结论只有一句话——SWA512 + Elementwise Gated Attention——但排除过程中暴露的反直觉现象,几乎打翻了所有先验假设: 实验 预期 实际 ...
某 0.6B 验证模型做了新老架构对比:新架构 34/35 验证集更好,ceval +2.67, hellaswag +2.65, humaneval +1.59。但 iter-time 从 12.09s 涨到 38.32s——慢了 3.17 倍。同样的 GPU 时间,老架构能多训 3 倍 token。这是一个典型的”更好但更贵”的工程决策。 实验设定 用 0.6B 参数量做 proxy...
某 3B 模型和某开源 4B 模型的 loss 差了 0.08。纯粹加参数只能追回一半。最终靠 5 个正交创新逐步叠加——SWA、Gated Attention、SwiftKV、PLE、FFN 扩展——loss 从 1.966 直降到 1.882,反超目标。SFT 评测 0.65 完全追平。 这篇文章记录整个集成过程:每一步的独立验证、合并后的实际增益、以及为什么这些技术能无损叠加。 起...
TL;DR Claude 不只是写代码的工具,它更是一个随叫随到的系统管理员。 你只需要描述问题(”新开 tab 太慢”、”关闭编辑器总弹框”),Claude 就能完成诊断、定位瓶颈、修改配置、验证结果的完整闭环。本文通过三个真实场景,展示普通开发者如何用 Claude 把日常环境调优的时间从”搜一下午 StackOverflow”压缩到”5 分钟对话”。 一、核心观点:AI 协作的...
TL;DR 把一台 us-east-1 的 VPS(跑着 trojan-go + Tailscale exit node)跨区迁移到 ap-southeast-1,顺便把 SSH 端口从 22 改到 5432。结果三分钟内把自己的唯一 SSH 通道改没了,靠 EBS detach-attach 到一台临时 helper 实例才救回来。完整复盘 + Ubuntu 24.04 socket a...