multimodal 15
- 从 vanilla RoPE 到多模态 RoPE:位置编码的「解耦」之路
- Visual PLE 五种方法全军覆没:NTP-only 范式下自监督闭环缺失的完整诊断
- Embedding 占了模型 10% 参数却只做查表:从 tie-embeddings=yes 到 PLE 的工程演化
- 一个 Megatron flag 把多模态梯度稀释了 17 倍:--calculate-per-token-loss 的生产事故复盘
- 只在 Answer 上算 Loss、MTP λ=0.3 到底带来多少:从实验配置反推 Loss 设计的工程决策
- 把 point 当普通文本训练, UIAgent 指标直接崩了: 多模态 Special Token 的隐形碰撞
- PLE 参数扩展的死区现象:为什么 dP=64→128 完全不降 loss
- 训练 Loss 不动但模型已坏?Adam 漂移、Softmax 饱和、梯度稀释三大隐形杀手
- 同样的数据重复 20 遍不过拟合?数据配比中那些反直觉的 Scaling Law
- 5 个独立创新逐步叠加, 从 loss 1.966 到 1.882 追平 Qwen3-4B: 架构集成的工程叙事
- 机器人 VLA 训推加速:OpenVLA / π0 / RDT-1B / GR00T 的实时控制工程
- Moonshot Kimi 系列技术洞察:从 K1.5 到 K2.6 的架构、优化器、训推工程
- 端侧多模态端到端加速:MiniCPM-o / Gemma 3n / Qwen3-Omni
- 使用Coding Agent 作为通用智能体完成 DeepResearch 任务
- Gemini Pro Vision 作为 表格 OCR 解决方案的简单测试