ai-ml 73
- 从 vanilla RoPE 到多模态 RoPE:位置编码的「解耦」之路
- DMD → DMD2:扩散模型一步蒸馏,从分布匹配到超越教师
- KL 散度、Cosine、Sim:大模型训练里的“相近”到底怎么量?一个数值实验告诉你它们有多不同
- Visual PLE 五种方法全军覆没:NTP-only 范式下自监督闭环缺失的完整诊断
- multi_doc_qa 从 0.086 涨到 0.200: SWA + LowRank Gated + Hybrid RoPE 的长文配方
- SAM in Annealing: Loss Landscape Geometry Determines Quantization Robustness
- MoE 做 RL 训练时 Routing 决策飘了:一个零成本的 Replay 方案消除了精度不一致
- Format Switch 的收益是 Ratio 调整的 8-60 倍: daVinci-LLM 200 次消融揭示的预训练数据工程三大定律
- MTP 白送 1.8x 加速、接受率还能当质量探针:从辅助 Loss 到推理加速的意外收获
- Activation Recomputation 不是免费午餐:recompute 24 层 vs 16 层导致 loss 显著偏高
- Grad-norm 一直 0.21 突然飙到 50:从真实训练日志看梯度工程的六个生死细节
- Vocab 100K 吃掉模型 10% 参数:一个 Tokenizer 决策如何锁死后续所有训练
- SwiftKV — KV Cache 跨层预测从预训练到 RL 的完整工程叙事
- SWA + Gated Attention — Loss 降了 0.013 但窗口越小评测越差的反直觉实验
- RMSNorm scalar 漂移到 56 训练 Loss 却不动:Softmax 的量化照妖镜与温度调控术
- Sample Packing + Attention Masking:未定义变量减少 52.7% 的预训练工程细节
- 长文 Loss 突然涨了 0.004:一次 RoPE × SWA 的冲突复盘与位置编码扩展全解
- 只在 Answer 上算 Loss、MTP λ=0.3 到底带来多少:从实验配置反推 Loss 设计的工程决策
- 蒸馏就是 RL、学生能超越老师:On-Policy Distillation 统一框架与六个落地范式
- 为什么多模态训练不要 Warmup:从四份真实 LR 配置看学习率调度的工程哲学
- Token Superposition Training:2.5x 预训练加速但重新初始化 embedding 就翻车
- 接受率从 0% 调到 90%:MTP 投机解码的工程调优全记录与 Drafter 质量诊断
- 81% Sparsity 只掉 0.48 分却快了 7 倍:从 Flash Attention 到训练时稀疏的 IO-Aware 全景
- 多教师蒸馏的温度工程:从 T=1 到 per-teacher adaptive temperature 的实验叙事
- 目标数据重复 15-20 遍不过拟合:混合训练的 Scaling Law 推翻了'4 epoch 定律'
- 4K→1M 上下文扩展只用了 2000 步:三份真实长文训练配置的工程复盘
- 训练 Loss 不动但模型已坏?Adam 漂移、Softmax 饱和、梯度稀释三大隐形杀手
- 同样的数据重复 20 遍不过拟合?数据配比中那些反直觉的 Scaling Law
- 7B 模型重复 8 次只保留 25% 有效信息, 400M 保留 50%: 大模型比小模型对数据重复更敏感
- 30 条数据 + GRPO 就能涨 10 分:2025-2026 RL for LLM 的算法选型与框架实战
- Attention Residual 拿了 0.025 的 loss 收益, 但 PyTorch 实现慢了 90%: Triton Kernel 怎么把开销压到 14%
- Layer Scalar 不加 Weight Decay 漂到 56, 为什么 Bias 不加却安然无恙: 一个用具体数字说明的数学推导
- 水印消除 / 图像编辑模型训练加速:Inpainting / Instruct-Edit / Flux Fill 的 2024~2026 栈
- 视频 & 3D 扩散训推加速:Wan 2.2 / HunyuanVideo / VSA / Gaussian Splatting
- 训推加速模型效果指标全景:客观指标 + 主观评价 + 加速退化信号
- Design Spec — 训推加速系列深化 9 篇(2026-05-08)
- 训推加速技术地图:三维分类 + 全景图 + 决策流 + 大模型加速术语表
- 语音 / 音频模型加速新常识:从 Audio Tokenizer 到 Full-duplex 对话
- Speculative Decoding 实战:vLLM 框架下 EAGLE-3 原理与工程落地
- 视频图像分割模型技术洞察与训练加速:SAM 2 / SAM 3 / Grounded-SAM / 视频 Mask 的 2024~2026 栈
- 机器人 VLA 训推加速:OpenVLA / π0 / RDT-1B / GR00T 的实时控制工程
- 音乐生成加速:Suno / MusicLM / UniAudio / Stable Audio
- MoE 训练加速实战:DeepEP + Grouped GeMM + Aux-Loss-Free 的 Qwen3.5 配方
- MoE 教师 → Dense 学生:2024~2026 开源社区的落地范式
- 图像 Diffusion 训推加速深化:FLUX / SD3 / DMD2 / SageAttention
- Qwen3-8B 下让 Gradient Checkpointing 收益最大化:选择性重算 + Pareto 曲线
- 替换 Fused Kernel 后如何对齐训推精度:7 类差异来源 + 3 道验证 Gate + 8 个实战技巧
- Qwen3-8B 下 CUDA Graph 的合理使用:训练 / 推理分场景 + 陷阱清单
- 训推加速 Qwen3 实战:从"调包"到手写 Triton Kernel(含 backward)
- Design Spec — 训推加速三新篇:精度对齐 / Gradient Checkpointing / CUDA Graph
- 语音模型预处理流程及常用术语详解:从声波到 Log-Mel 到 Audio-LLM
- 训推加速 Qwen3 实战:看懂模型结构 + 识别算子融合机会
- Design Spec — 训推加速系列:看懂 Qwen3 + Fusion 识别 + Triton 实战
- vLLM v0.20 显存优化与推理加速实战指南
- 大模型训推高质量社区、技术博客与资源索引
- LLM 训练显存估算全指南:从 ZeRO 到 MoE
- Transformer 前向流程与自注意力机制简述
- 深度学习中的矩阵运算与线性代数基础
- 训练大模型时,优化器状态到底在吃多少显存
- Tinker RL 测试(含代码库)
- LLM 量化(GPTQ、GGUF)实战以及效果和推理性能实测
- 大语言模型高质量数据集汇总
- DeepSeek R1 阅读清单
- Embedding Model Fine-Tuning 案例
- 中文 Emebedding & Reranker 模型选型
- Gemini Pro Vision 作为 表格 OCR 解决方案的简单测试
- 大语言模型(LLM)推理性能优化以及推理框架、后端的评测
- Embedding 模型在 RAG 场景下的评估和微调
- 大语言模型(LLM)学习路径和资料汇总
- 中文模型 C-Eval 评测结果简单小评测
- 大语言模型(LLM)后训练数据准备相关笔记
- 值得关注的对中文支持较好的开源模型
- 大语言模型(LLM)微调技术笔记