edge 4 Activation Recomputation 不是免费午餐:recompute 24 层 vs 16 层导致 loss 显著偏高 Jun 10, 2026 Vocab 100K 吃掉模型 10% 参数:一个 Tokenizer 决策如何锁死后续所有训练 Jun 10, 2026 SwiftKV 预测 12 层 loss 最低, 但最终选了 16 层: 端侧首词提速 35% 的工程决策 Jun 10, 2026 端侧多模态端到端加速:MiniCPM-o / Gemma 3n / Qwen3-Omni May 8, 2026