Qian, Cheng

vLLM v0.20 显存优化与推理加速实战指南

引子 部署大模型时,工程师面对的核心矛盾始终是:显存不够用和推理速度不够快。vLLM v0.20 在这两个维度上提供了系统性的工具箱——从 KV Cache 量化、PagedAttention、前缀缓存,到 CUDA Graph、torch.compile 融合、投机解码,每一层都有可调旋钮。 本文基于 vLLM v0.20 源码,系统梳理各项优化手段、原理与 CLI 用法,帮助工程师快...

vLLM v0.20 架构深度解析:双引擎、调度器、KV Cache 与分布式推理

引子 vLLM 是目前生产环境中最广泛使用的大模型推理框架之一。v0.20 版本在保持向后兼容的同时,将主力执行路径完全迁移到了全新的 V1 引擎——进程分离架构、ZMQ IPC 通信、全新调度器。 本文基于 vLLM v0.20 源码,系统梳理其整体架构、数据流、核心组件和高级特性,帮助工程师快速建立完整的架构心智模型。 一、顶层目录结构 vllm_0_20/ ├── vllm...

Hermes Agent 完全 YOLO 模式:彻底关掉「approve this command?」确认框

问题背景 用 Hermes Agent 跑自动化任务时,它会对”危险命令”(rm -rf、git push --force、docker 等)弹出确认提示,要手动 approve 才能继续。单次交互场景还好,但在自动化 pipeline 或高频调试环境里,这种中断极其烦人。 光改一两个配置项不够——Hermes 的审批系统有多层控制,必须全部关闭才能真正实现 YOLO。 审批系统的...