强化学习 5 蒸馏就是 RL、学生能超越老师:On-Policy Distillation 统一框架与六个落地范式 Jun 10, 2026 KV Cache 共享让文本榜单掉了 1.9%,但 RL 四轮迭代后反超 baseline 1.4%: 架构退化的 RL 补偿机制 Jun 10, 2026 GRPO 训了 3 天模型反而不调工具了:Tool Use RL 的 Interaction Collapse 与六个结构性修复 Jun 10, 2026 30 条数据 + GRPO 就能涨 10 分:2025-2026 RL for LLM 的算法选型与框架实战 Jun 10, 2026 RL 训练加速实战:Qwen3.5 + vLLM + veRL 的 fully-async 架构 May 8, 2026