深度学习 71
- Visual PLE 五种方法全军覆没:NTP-only 范式下自监督闭环缺失的完整诊断
- multi_doc_qa 从 0.086 涨到 0.200: SWA + LowRank Gated + Hybrid RoPE 的长文配方
- SAM in Annealing: Loss Landscape Geometry Determines Quantization Robustness
- MoE 做 RL 训练时 Routing 决策飘了:一个零成本的 Replay 方案消除了精度不一致
- up_proj 和 gated_proj 共享权重减 50% FFN 参数: 16 个验证集全部退化的干净失败
- Format Switch 的收益是 Ratio 调整的 8-60 倍: daVinci-LLM 200 次消融揭示的预训练数据工程三大定律
- RMSNorm 后的 Layer Scalar 漂移到 56 但训练 Loss 纹丝不动:一个 Adam 优化器的隐形 Bug
- MTP 白送 1.8x 加速、接受率还能当质量探针:从辅助 Loss 到推理加速的意外收获
- Activation Recomputation 不是免费午餐:recompute 24 层 vs 16 层导致 loss 显著偏高
- Grad-norm 一直 0.21 突然飙到 50:从真实训练日志看梯度工程的六个生死细节
- Embedding 占了模型 10% 参数却只做查表:从 tie-embeddings=yes 到 PLE 的工程演化
- Vocab 100K 吃掉模型 10% 参数:一个 Tokenizer 决策如何锁死后续所有训练
- RMSNorm scalar 漂移到 56 训练 Loss 却不动:Softmax 的量化照妖镜与温度调控术
- 长文 Loss 突然涨了 0.004:一次 RoPE × SWA 的冲突复盘与位置编码扩展全解
- 一个 Megatron flag 把多模态梯度稀释了 17 倍:--calculate-per-token-loss 的生产事故复盘
- Loss Spike 频率降了 80%:从 Adam 到 MuonClip,万亿参数 MoE 的优化器进化实战
- 只在 Answer 上算 Loss、MTP λ=0.3 到底带来多少:从实验配置反推 Loss 设计的工程决策
- 蒸馏就是 RL、学生能超越老师:On-Policy Distillation 统一框架与六个落地范式
- KV Cache 砍 90%、推理提速 7x:六个正交架构创新如何叠加生效
- 为什么多模态训练不要 Warmup:从四份真实 LR 配置看学习率调度的工程哲学
- SWA + Gated Attention loss 降了 0.013:从一个 3B 模型实验看 Attention 演化的工程选择
- seq_len 从 4K 推到 16K、CP=2 一开就慢了 20%:Ulysses Context Parallelism 的工程取舍全记录
- Token Superposition Training:2.5x 预训练加速但重新初始化 embedding 就翻车
- KV Cache 共享让文本榜单掉了 1.9%,但 RL 四轮迭代后反超 baseline 1.4%: 架构退化的 RL 补偿机制
- SwiftKV 预测 12 层 loss 最低, 但最终选了 16 层: 端侧首词提速 35% 的工程决策
- 接受率从 0% 调到 90%:MTP 投机解码的工程调优全记录与 Drafter 质量诊断
- 把 point 当普通文本训练, UIAgent 指标直接崩了: 多模态 Special Token 的隐形碰撞
- 81% Sparsity 只掉 0.48 分却快了 7 倍:从 Flash Attention 到训练时稀疏的 IO-Aware 全景
- GRPO 训了 3 天模型反而不调工具了:Tool Use RL 的 Interaction Collapse 与六个结构性修复
- Partial MoE Scaling Law: 后16层换MoE、1/8激活比丢了17-19%性能的真实代价
- Router 梯度和 Expert 梯度分开裁剪, Loss Spike 频率降了 80%: MoE 训练稳定性的优化器视角
- 512 Expert 里 80% 是死的:从 MuonClip 到 Expert Upcycling,MoE 训练稳定性的三个生死问题
- 目标数据重复 15-20 遍不过拟合:混合训练的 Scaling Law 推翻了'4 epoch 定律'
- 4K→1M 上下文扩展只用了 2000 步:三份真实长文训练配置的工程复盘
- 训练 Loss 不动但模型已坏?Adam 漂移、Softmax 饱和、梯度稀释三大隐形杀手
- 上线才发现的坑:Token Budget 设计、Function Calling 格式战争与 Proxy Metric 翻车
- 同样的数据重复 20 遍不过拟合?数据配比中那些反直觉的 Scaling Law
- 7B 模型重复 8 次只保留 25% 有效信息, 400M 保留 50%: 大模型比小模型对数据重复更敏感
- 30 条数据 + GRPO 就能涨 10 分:2025-2026 RL for LLM 的算法选型与框架实战
- CoLA 说参数减 45% 不掉点,我们的 3B 实验说 6.85T tokens 才能追平:一个精确的负面结果
- CoLA 放在 up_proj 收敛快 2.3 倍: FFN 内部低秩最优落点的定位实验
- Attention Residual 拿了 0.025 的 loss 收益, 但 PyTorch 实现慢了 90%: Triton Kernel 怎么把开销压到 14%
- Layer Scalar 不加 Weight Decay 漂到 56, 为什么 Bias 不加却安然无恙: 一个用具体数字说明的数学推导
- 五次排除实验定位 Attention 门控最优解:Sink 无效、RoPE 反噬、小窗口翻车
- 新架构 34/35 验证集更好、ceval +2.67 pt, 但 iter-time 慢了 3.17 倍: 结构升级的效率代价决策
- 5 个独立创新逐步叠加, 从 loss 1.966 到 1.882 追平 Qwen3-4B: 架构集成的工程叙事
- 水印消除 / 图像编辑模型训练加速:Inpainting / Instruct-Edit / Flux Fill 的 2024~2026 栈
- 视频 & 3D 扩散训推加速:Wan 2.2 / HunyuanVideo / VSA / Gaussian Splatting
- 训推加速模型效果指标全景:客观指标 + 主观评价 + 加速退化信号
- 训推加速效率指标全景:吞吐 / 延迟 / MFU / TGS / SLO(含数学公式)
- 训推加速技术地图:三维分类 + 全景图 + 决策流 + 大模型加速术语表
- 语音 / 音频模型加速新常识:从 Audio Tokenizer 到 Full-duplex 对话
- Speculative Decoding 实战:vLLM 框架下 EAGLE-3 原理与工程落地
- 视频图像分割模型技术洞察与训练加速:SAM 2 / SAM 3 / Grounded-SAM / 视频 Mask 的 2024~2026 栈
- 机器人 VLA 训推加速:OpenVLA / π0 / RDT-1B / GR00T 的实时控制工程
- RL 训练加速实战:Qwen3.5 + vLLM + veRL 的 fully-async 架构
- 音乐生成加速:Suno / MusicLM / UniAudio / Stable Audio
- MoE 训练加速实战:DeepEP + Grouped GeMM + Aux-Loss-Free 的 Qwen3.5 配方
- MoE 教师 → Dense 学生:2024~2026 开源社区的落地范式
- Moonshot Kimi 系列技术洞察:从 K1.5 到 K2.6 的架构、优化器、训推工程
- 图像 Diffusion 训推加速深化:FLUX / SD3 / DMD2 / SageAttention
- Qwen3-8B 下让 Gradient Checkpointing 收益最大化:选择性重算 + Pareto 曲线
- 替换 Fused Kernel 后如何对齐训推精度:7 类差异来源 + 3 道验证 Gate + 8 个实战技巧
- 端侧多模态端到端加速:MiniCPM-o / Gemma 3n / Qwen3-Omni
- Qwen3-8B 下 CUDA Graph 的合理使用:训练 / 推理分场景 + 陷阱清单
- 训推加速 Qwen3 实战:从"调包"到手写 Triton Kernel(含 backward)
- 训推加速问题定位 SOP 与 Know-how:从 GPU 低利用率到 NCCL hang 到推理吞吐
- 语音识别模型架构演进:从 HMM-GMM 到 Whisper 到 Qwen3-ASR
- 语音模型基础篇:用预训练 ASR 模型搞定语音识别(从 Wav2Vec2 到 Whisper 实战)
- 语音模型预处理流程及常用术语详解:从声波到 Log-Mel 到 Audio-LLM
- 训推加速 Qwen3 实战:看懂模型结构 + 识别算子融合机会