rl 13
- MoE 做 RL 训练时 Routing 决策飘了:一个零成本的 Replay 方案消除了精度不一致
- MTP 白送 1.8x 加速、接受率还能当质量探针:从辅助 Loss 到推理加速的意外收获
- 蒸馏就是 RL、学生能超越老师:On-Policy Distillation 统一框架与六个落地范式
- KV Cache 共享让文本榜单掉了 1.9%,但 RL 四轮迭代后反超 baseline 1.4%: 架构退化的 RL 补偿机制
- GRPO 训了 3 天模型反而不调工具了:Tool Use RL 的 Interaction Collapse 与六个结构性修复
- 多教师蒸馏的温度工程:从 T=1 到 per-teacher adaptive temperature 的实验叙事
- 上线才发现的坑:Token Budget 设计、Function Calling 格式战争与 Proxy Metric 翻车
- 30 条数据 + GRPO 就能涨 10 分:2025-2026 RL for LLM 的算法选型与框架实战
- RL 训练加速实战:Qwen3.5 + vLLM + veRL 的 fully-async 架构
- MoE 教师 → Dense 学生:2024~2026 开源社区的落地范式
- OpenClaw 思考
- 自主 Agent / 上下文工程资料索引
- Tinker RL 测试(含代码库)