kv-cache 9
- SwiftKV — KV Cache 跨层预测从预训练到 RL 的完整工程叙事
- KV Cache 砍 90%、推理提速 7x:六个正交架构创新如何叠加生效
- SWA + Gated Attention loss 降了 0.013:从一个 3B 模型实验看 Attention 演化的工程选择
- KV Cache 共享让文本榜单掉了 1.9%,但 RL 四轮迭代后反超 baseline 1.4%: 架构退化的 RL 补偿机制
- SwiftKV 预测 12 层 loss 最低, 但最终选了 16 层: 端侧首词提速 35% 的工程决策
- 81% Sparsity 只掉 0.48 分却快了 7 倍:从 Flash Attention 到训练时稀疏的 IO-Aware 全景
- Speculative Decoding 实战:vLLM 框架下 EAGLE-3 原理与工程落地
- vLLM v0.20 显存优化与推理加速实战指南
- vLLM v0.20 架构深度解析:双引擎、调度器、KV Cache 与分布式推理