methodology 24
- arXiv 论文分诊方法论:如何用 6 个维度 30 秒筛出一篇值得精读的论文
- up_proj 和 gated_proj 共享权重减 50% FFN 参数: 16 个验证集全部退化的干净失败
- Format Switch 的收益是 Ratio 调整的 8-60 倍: daVinci-LLM 200 次消融揭示的预训练数据工程三大定律
- CoLA 说参数减 45% 不掉点,我们的 3B 实验说 6.85T tokens 才能追平:一个精确的负面结果
- CoLA 放在 up_proj 收敛快 2.3 倍: FFN 内部低秩最优落点的定位实验
- Layer Scalar 不加 Weight Decay 漂到 56, 为什么 Bias 不加却安然无恙: 一个用具体数字说明的数学推导
- 新架构 34/35 验证集更好、ceval +2.67 pt, 但 iter-time 慢了 3.17 倍: 结构升级的效率代价决策
- 5 个独立创新逐步叠加, 从 loss 1.966 到 1.882 追平 Qwen3-4B: 架构集成的工程叙事
- Design Spec — 训推加速系列深化 9 篇(2026-05-08)
- 训推加速问题定位 SOP 与 Know-how:从 GPU 低利用率到 NCCL hang 到推理吞吐
- Design Spec — 训推加速三新篇:精度对齐 / Gradient Checkpointing / CUDA Graph
- Design Spec — 训推加速系列:看懂 Qwen3 + Fusion 识别 + Triton 实战
- 训推加速 Python 侧排障 SOP:OOM / GIL / asyncio / DataLoader / IO
- Cursor Free Plan 接入第三方 BlueRouter 网关调研(WIP)
- 大模型训推高质量社区、技术博客与资源索引
- 中国营销中的央视平台投放:ROI分析、文化心理与洞察
- 深度学习中的矩阵运算与线性代数基础
- 自主 Agent / 上下文工程资料索引
- AI Tech Blog
- DeepSeek R1 阅读清单
- 实现基于 Github Issues 的博客
- 大语言模型(LLM)学习路径和资料汇总
- 大语言模型(LLM)后训练数据准备相关笔记
- 值得关注的对中文支持较好的开源模型