Qian, Cheng

Moonshot Kimi 系列技术洞察:从 K1.5 到 K2.6 的架构、优化器、训推工程

一篇公司技术洞察。内容基于公开论文 / 技术报告 / HuggingFace / GitHub 的可核实材料整理,细节以 Moonshot 官方发布为准。 姊妹篇:训推加速技术地图 · MoE 训练加速 · RL 训练加速 最后更新:2026-05-08 零、一句话背景 Moonshot AI(月之暗面)创立于 2023,杨植麟等清华背景创始团队,产品品牌 Kimi。2...

替换 Fused Kernel 后如何对齐训推精度:7 类差异来源 + 3 道验证 Gate + 8 个实战技巧

系列姊妹篇:从”调包”到手写 Triton Kernel · 看懂 Qwen3 + 识别算子融合机会 · GPU/NCCL SOP · Python CPU SOP 前篇教你怎么写 fused kernel,这篇教你怎么验证它和原版数值一致——这是替换后能不能真正上训练的最后一关。最常见的翻车场景:kernel 写对了、loss 能收敛,但下游任务指标偷偷掉了 1~2 个点,等跑完 1...

端侧多模态端到端加速:MiniCPM-o / Gemma 3n / Qwen3-Omni

训推加速系列深化之”端侧多模态”专题。2024~2026 多模态模型从”云端专属”下沉到”手机 / 笔记本 / 嵌入式”——<3B 参数 + <5GB 显存 + 实时性 三重约束下的端到端多模态加速栈。 姊妹篇:训推加速技术地图 · 语音 / 音频加速 · MoE→Dense 蒸馏 ⚠️ 时效声明(最后更新:2026-05-08):MiniCPM-o 4.0 / Ge...

Qwen3-8B 下 CUDA Graph 的合理使用:训练 / 推理分场景 + 陷阱清单

系列姊妹篇:看懂 Qwen3 + 识别算子融合机会 · Triton Kernel 实战 · 精度对齐实战 · Gradient Checkpointing 最大化 CUDA Graph 是训推最后一个”免费午餐”——但前提是你知道什么时候用、什么时候别碰。动态 shape / 长度变化 / Python 控制流都会把它变成负收益。本篇按训练和推理两个场景分别讲 Qwen3-8B 下的...

训推加速 Qwen3 实战:从"调包"到手写 Triton Kernel(含 backward)

前篇:训推加速 Qwen3 实战:看懂模型结构 + 识别算子融合机会 前一篇教你”识别 fusion 机会”,这一篇讲”有了机会怎么落地“——先看现成的 fused kernel 库够不够用,不够再自己写 Triton。重头戏是 backward kernel:多数教程只讲 forward,但训练场景 forward + backward 都要亲自写才能吃完整收益。 本篇 sta...

训推工程师 & AI Agent 时代的高效 CLI 工具栈:从 zoxide 到 nvitop 到 Claude Code

写给一手训模型 / 调推理 / 和 AI Agent 协作编程的工程师。全文不堆砌 “100 个 CLI 工具” 清单,而是按真实工作流的动线给出每个阶段的首选+备选,再配 mermaid 动线图和实测截图。能实测的我自己用过,不能实测的标”未实测”。 参考: 豆包总结的高效 CLI 工具清单。本文在它基础上做了大量筛选 + 训推/Agent 视角的重构。 一、先把动线画出来 ...

训推加速问题定位 SOP 与 Know-how:从 GPU 低利用率到 NCCL hang 到推理吞吐

这是 《训推工程师 & AI Agent 时代的高效 CLI 工具栈》 的姊妹篇。 前一篇讲”用什么工具“,这一篇讲”遇到问题怎么从症状一路打到根因“——训推工程师的排障地图。每个症状下给出定位动线 + 对应工具 + 关键决策点 + 权威资料链接。 所有 SOP 都刻意写成可以粘到 AGENTS.md 给 AI Agent 看的形式——不是人读才能跑的流程。 零、...

语音模型基础篇:用预训练 ASR 模型搞定语音识别(从 Wav2Vec2 到 Whisper 实战)

本文是”语音模型三部曲”的基础篇。前两篇分别讲 预处理与术语(讲输入怎么来)和 架构演进(讲模型代际)。这一篇换个视角——动手用预训练 ASR 模型,把两大经典架构 Wav2Vec2(CTC)和 Whisper(Seq2Seq)的特性、差异、长音频处理全跑一遍。 内容整合自 HuggingFace Audio Course Unit 5,用中文重写并补充 mermaid 流程图与实战坑...