Qian, Cheng

同样的数据重复 20 遍不过拟合?数据配比中那些反直觉的 Scaling Law

大模型训练中,数据工程的决策往往比模型架构更影响最终效果。本文从四个维度系统梳理数据配比、重复、多样性与质量的量化决策框架,提供可直接落地的方法论。 1. 通用数据是稀有领域重复的隐式正则化 在实际项目中,目标领域数据(如医疗、法律、代码)往往远少于通用语料。2026 年一项关于混合训练的 Scaling Law 研究揭示了一个关键机制:通用数据的持续注入本质上是对稀缺领域重复的隐式...

7B 模型重复 8 次只保留 25% 有效信息, 400M 保留 50%: 大模型比小模型对数据重复更敏感

7B 模型把训练数据重复 8 次,有效信息只剩 25%。同样的数据重复 8 次给 400M 模型,保留 50%。大模型比小模型对重复更敏感——这颠覆了”大模型能从数据中学到更多”的直觉。 InfoLaw 提出了一个统一的信息论框架,量化了数据重复、数据质量和模型规模三者之间的交互关系。核心发现:repetition decay 不是常数,而是模型规模的递增函数。模型越大,重复数据的边际信息...

CoLA 说参数减 45% 不掉点,我们的 3B 实验说 6.85T tokens 才能追平:一个精确的负面结果

CoLA 论文声称参数减 45% 不掉点。我们在某 3B 模型的 FFN 上实测:全低秩方案(r=640) 训了 158B token,loss 差 0.18 当场判死刑。单点低秩(up_proj, r=1280) 好得多——但 power-law 外推说 6.85T tokens 才能追平 baseline。这比我们的训练预算大了 3.8 倍。 这篇文章记录一个完整的负面结果。不是”方法...

CoLA 放在 up_proj 收敛快 2.3 倍: FFN 内部低秩最优落点的定位实验

CoLA 论文说低秩化能减 45% 参数不掉点。我们在某 3B 模型上验证:放在 down_proj 收敛比放在 up_proj 慢 2.3 倍,放在全部三个投影直接崩了(+0.17 loss)。FFN 内部不是哪里都能做低秩的——up_proj 是唯一可行的落点。 SwiGLU FFN 结构与三个可选落点 某 3B 模型的 FFN 采用 SwiGLU 结构: output = dow...

Attention Residual 拿了 0.025 的 loss 收益, 但 PyTorch 实现慢了 90%: Triton Kernel 怎么把开销压到 14%

某 3B 模型架构搜索中,Block Attention Residual 带来了 0.025 的 loss 收益——不加任何参数。但 PyTorch 实现直接慢了 90%,整个训练周期要翻倍。Triton kernel 迭代两版后把开销压到 14%,让这个”免费”的收益真正能用上。 这个 case 的核心教训:研究上有效的结构创新,离工程落地往往差一个 kernel 的距离。 Bloc...

Layer Scalar 不加 Weight Decay 漂到 56, 为什么 Bias 不加却安然无恙: 一个用具体数字说明的数学推导

某 3B 模型的 Layer Scalar 不加 weight decay 漂到了 56.25(详见上篇)。顺理成章的追问:bias 也不加 weight decay,它为什么不漂?答案藏在一个简单的数学性质里——bias 对所有样本加相同常数,帮了一部分就必然害另一部分。这形成了天然的有限平衡点。 1. 行业标准:所有主流框架都把 bias 排除在 weight decay 之外 ...

新架构 34/35 验证集更好、ceval +2.67 pt, 但 iter-time 慢了 3.17 倍: 结构升级的效率代价决策

某 0.6B 验证模型做了新老架构对比:新架构 34/35 验证集更好,ceval +2.67, hellaswag +2.65, humaneval +1.59。但 iter-time 从 12.09s 涨到 38.32s——慢了 3.17 倍。同样的 GPU 时间,老架构能多训 3 倍 token。这是一个典型的”更好但更贵”的工程决策。 实验设定 用 0.6B 参数量做 proxy...

5 个独立创新逐步叠加, 从 loss 1.966 到 1.882 追平 Qwen3-4B: 架构集成的工程叙事

某 3B 模型和某开源 4B 模型的 loss 差了 0.08。纯粹加参数只能追回一半。最终靠 5 个正交创新逐步叠加——SWA、Gated Attention、SwiftKV、PLE、FFN 扩展——loss 从 1.966 直降到 1.882,反超目标。SFT 评测 0.65 完全追平。 这篇文章记录整个集成过程:每一步的独立验证、合并后的实际增益、以及为什么这些技术能无损叠加。 起...

普通人如何用好 Claude 协作办公:开发环境优化实战

TL;DR Claude 不只是写代码的工具,它更是一个随叫随到的系统管理员。 你只需要描述问题(”新开 tab 太慢”、”关闭编辑器总弹框”),Claude 就能完成诊断、定位瓶颈、修改配置、验证结果的完整闭环。本文通过三个真实场景,展示普通开发者如何用 Claude 把日常环境调优的时间从”搜一下午 StackOverflow”压缩到”5 分钟对话”。 一、核心观点:AI 协作的...