inference 14
- 接受率从 0% 调到 90%:MTP 投机解码的工程调优全记录与 Drafter 质量诊断
- Partial MoE Scaling Law: 后16层换MoE、1/8激活比丢了17-19%性能的真实代价
- Design Spec — 训推加速系列深化 9 篇(2026-05-08)
- 训推加速技术地图:三维分类 + 全景图 + 决策流 + 大模型加速术语表
- Speculative Decoding 实战:vLLM 框架下 EAGLE-3 原理与工程落地
- Qwen3-8B 下 CUDA Graph 的合理使用:训练 / 推理分场景 + 陷阱清单
- vLLM v0.20 显存优化与推理加速实战指南
- 大模型训推高质量社区、技术博客与资源索引
- PyTorch Profiler 瓶颈分析全指南(实战版)
- LLM 量化(GPTQ、GGUF)实战以及效果和推理性能实测
- 使用Coding Agent 作为通用智能体完成 DeepResearch 任务
- 不同硬件和推理引擎模型输出的精度差异
- 大语言模型(LLM)推理性能优化以及推理框架、后端的评测
- 大语言模型(LLM)学习路径和资料汇总