Moonshot Kimi 系列技术洞察:从 K1.5 到 K2.6 的架构、优化器、训推工程
一篇公司技术洞察。内容基于公开论文 / 技术报告 / HuggingFace / GitHub 的可核实材料整理,细节以 Moonshot 官方发布为准。 姊妹篇:训推加速技术地图 · MoE 训练加速 · RL 训练加速 最后更新:2026-05-08 零、一句话背景 Moonshot AI(月之暗面)创立于 2023,杨植麟等清华背景创始团队,产品品牌 Kimi。2...
一篇公司技术洞察。内容基于公开论文 / 技术报告 / HuggingFace / GitHub 的可核实材料整理,细节以 Moonshot 官方发布为准。 姊妹篇:训推加速技术地图 · MoE 训练加速 · RL 训练加速 最后更新:2026-05-08 零、一句话背景 Moonshot AI(月之暗面)创立于 2023,杨植麟等清华背景创始团队,产品品牌 Kimi。2...
训推加速系列深化之”图像 Diffusion 专题”。2024~2026 图像扩散领域同时上演三条加速主线——步数蒸馏(DMD2 / LCM 系)、新架构(DiT / MMDiT / Rectified Flow)、低精度 Attention(SageAttention / SVDQuant)。本文聚焦图像(视频 / 3D 扩散见下一篇)。 姊妹篇:训推加速技术地图 · Specula...
系列姊妹篇:看懂 Qwen3 + 识别算子融合机会 · 手写 Triton Kernel · 精度对齐实战 · GPU SOP 大多数 Qwen3 / Llama 训练教程给的 gradient checkpointing 指引都是”model.gradient_checkpointing_enable() 打开就行”——这其实是最粗粒度的配置,显存换算力的比例通常不划算。本篇讲怎么把...
系列姊妹篇:从”调包”到手写 Triton Kernel · 看懂 Qwen3 + 识别算子融合机会 · GPU/NCCL SOP · Python CPU SOP 前篇教你怎么写 fused kernel,这篇教你怎么验证它和原版数值一致——这是替换后能不能真正上训练的最后一关。最常见的翻车场景:kernel 写对了、loss 能收敛,但下游任务指标偷偷掉了 1~2 个点,等跑完 1...
训推加速系列深化之”端侧多模态”专题。2024~2026 多模态模型从”云端专属”下沉到”手机 / 笔记本 / 嵌入式”——<3B 参数 + <5GB 显存 + 实时性 三重约束下的端到端多模态加速栈。 姊妹篇:训推加速技术地图 · 语音 / 音频加速 · MoE→Dense 蒸馏 ⚠️ 时效声明(最后更新:2026-05-08):MiniCPM-o 4.0 / Ge...
系列姊妹篇:看懂 Qwen3 + 识别算子融合机会 · Triton Kernel 实战 · 精度对齐实战 · Gradient Checkpointing 最大化 CUDA Graph 是训推最后一个”免费午餐”——但前提是你知道什么时候用、什么时候别碰。动态 shape / 长度变化 / Python 控制流都会把它变成负收益。本篇按训练和推理两个场景分别讲 Qwen3-8B 下的...
前篇:训推加速 Qwen3 实战:看懂模型结构 + 识别算子融合机会 前一篇教你”识别 fusion 机会”,这一篇讲”有了机会怎么落地“——先看现成的 fused kernel 库够不够用,不够再自己写 Triton。重头戏是 backward kernel:多数教程只讲 forward,但训练场景 forward + backward 都要亲自写才能吃完整收益。 本篇 sta...
写给一手训模型 / 调推理 / 和 AI Agent 协作编程的工程师。全文不堆砌 “100 个 CLI 工具” 清单,而是按真实工作流的动线给出每个阶段的首选+备选,再配 mermaid 动线图和实测截图。能实测的我自己用过,不能实测的标”未实测”。 参考: 豆包总结的高效 CLI 工具清单。本文在它基础上做了大量筛选 + 训推/Agent 视角的重构。 一、先把动线画出来 ...
这是 《训推工程师 & AI Agent 时代的高效 CLI 工具栈》 的姊妹篇。 前一篇讲”用什么工具“,这一篇讲”遇到问题怎么从症状一路打到根因“——训推工程师的排障地图。每个症状下给出定位动线 + 对应工具 + 关键决策点 + 权威资料链接。 所有 SOP 都刻意写成可以粘到 AGENTS.md 给 AI Agent 看的形式——不是人读才能跑的流程。 零、...
1. 定位 延续训推加速系列(已完成 6 篇:CLI toolkit / GPU SOP / CPU SOP / Qwen3 fusion 识别 / Triton 实战 / 以及其他预处理姊妹篇),新增 3 篇实战技巧深化: 篇 A:替换 fused kernel 后的精度对齐实战 篇 B:Qwen3-8B dense 下让 Gradient Checkpointing 收益最...
本文是 《语音模型预处理流程及常用术语详解》 的姊妹篇。前一篇讲”输入怎么来”,这一篇讲”模型怎么吃”。把 2012 ~ 2026 十四年的 ASR 架构演进捋清楚,并且重点拆解最新的 Qwen3-ASR(2026)。 一、代际总览 代际 时间 代表模型 核心思想 训练数据量级 ...
本文是”语音模型三部曲”的基础篇。前两篇分别讲 预处理与术语(讲输入怎么来)和 架构演进(讲模型代际)。这一篇换个视角——动手用预训练 ASR 模型,把两大经典架构 Wav2Vec2(CTC)和 Whisper(Seq2Seq)的特性、差异、长音频处理全跑一遍。 内容整合自 HuggingFace Audio Course Unit 5,用中文重写并补充 mermaid 流程图与实战坑...