从 vanilla RoPE 到多模态 RoPE:位置编码的「解耦」之路
RoPE(Rotary Position Embedding)是当下 LLM 的事实标准位置编码——Llama、Qwen、DeepSeek 全在用。但当模型从纯文本走向多模态(图像、视频、音频),RoPE 这套为 1D 序列设计的机制开始失灵。过去两年出现了一批多模态 RoPE 变体(MRoPE、VideoRoPE、Circle-RoPE、HoPE…),表面上看是各种补丁,实际上它们都在攻击...
RoPE(Rotary Position Embedding)是当下 LLM 的事实标准位置编码——Llama、Qwen、DeepSeek 全在用。但当模型从纯文本走向多模态(图像、视频、音频),RoPE 这套为 1D 序列设计的机制开始失灵。过去两年出现了一批多模态 RoPE 变体(MRoPE、VideoRoPE、Circle-RoPE、HoPE…),表面上看是各种补丁,实际上它们都在攻击...
多步扩散模型采样成本高昂——Stable Diffusion 需要 50 步,EDM 需要 511 步。将多步扩散模型蒸馏为单步生成器能实现 500 倍推理加速(0.09s 一张 512×512 图像),但核心挑战在于:一步生成如何匹配多步采样的质量? MIT 与 Adobe 的团队在两个连续工作中逐步攻克了这个难题:先以分布匹配 + 回归损失奠定基础(DMD, 2023.11),再以 T...
做 LLM 训练,几乎每天都要和”相近”打交道:蒸馏要让学生分布接近教师分布,RLHF 要约束新策略不能偏离旧策略太远,表征分析要比较不同层的 hidden state 像不像。但”相近”这个模糊的词,落到具体指标上却是完全不同的数学结构——KL 散度是信息论,Cosine 是几何,MSE 是代数。它们对同一份数据的回答可能完全相反,而训练结果就取决于你选对了哪一个。 这篇文章不只是罗列定...
如果你在 LLM 算法/系统方向做研究,arXiv 每天新论文的数量已经多到不可能全读。但现有的筛选方式都存在问题:只看引用数对太新的论文无效,只看标题摘要会漏掉真正有工程价值的贡献,而精读一篇不相关的论文要浪费 2-3 小时。 我整理了一套适合 LLM 算法/工程方向的论文分诊(triage)方法论,核心思路是 “减法优先,加权打分”。 为什么要造一套自己的方法论? 现有的论文筛选工...
GitHub 的搜索功能远比大多数人用到的强大。除了搜索框里敲关键词,它还支持丰富的限定符(qualifiers)、URL 参数拼接、以及 REST API 编程式搜索。本文系统梳理三种搜索方式的高级技巧,帮你快速定位代码、仓库和 Issue。 一、GitHub.com Web 搜索高级技巧 1.1 布尔运算符 运算符 说明 示...
Text PLE 给某 3B 多模态模型带来了 loss -0.023 的显著收益,仅增加 +883M 参数(dP=256)。我们自然想把同样的思路用到视觉 token 上。结果:5 种方法全军覆没,NTP loss 变化全在千分位级别。cos_sim 诊断显示 embedding 结构和随机初始化无异。这篇文章是对这次失败的完整诊断。 1. PLE 机制回顾:为什么 Text PLE...
某 3B 模型的 baseline 在 multi_doc_qa 上只有 0.086(几乎是 random)。加上 SWA + LowRank Gated + Hybrid RoPE 三件套后涨到 0.200——2.3 倍提升。最关键的组件不是 SWA(它只解决 OOM),而是 Hybrid RoPE(它让 attention 能做跨文档的内容匹配)。 1. 背景:长文 Fine-tu...
某 1B 模型做 4-bit 量化后精度掉了一截。调了各种量化方案都不管用。最后发现问题出在预训练阶段——换了一下退火阶段的优化器(仅最后 10% 步数),4-bit 量化退化直接减少了 40%。原因是 loss landscape 的几何形状比 loss 值本身更重要。 1. 低 Loss 不等于好部署 预训练的优化目标是最小化 loss。所有人默认:loss 越低 → base ...
某 309B MoE 模型做 Agentic RL 训练,reward 上升但比预期慢 30%。排查发现一个隐蔽问题:rollout 阶段(FP8)和梯度更新阶段(BF16)对同一个 token 选择了不同的 expert——MoE 的离散路由决策让浮点精度差异变成了路径分歧。修复只需 50 行代码:记录 rollout 时的路由索引,训练时直接重放。 1. RL 训练的两阶段结构 ...
某 3B 模型想减 FFN 参数:让 up_proj 和 gated_proj 共享权重,只用 1-bit mask 区分。听起来很聪明——参数减半,推理 IO 少一半。实测:16 个验证集全部退化,平均 +0.04,没有任何一个域有收益。67B token 后放弃。 MGLU 是什么 MGLU(Masked Gated Linear Unit)的核心想法:SwiGLU FFN 里的 g...
某 3B 模型(从零训练 8T tokens)整体 51.72 分与 7B 参数的 OLMo-3 打平。关键不是用了更多数据——而是 200 次消融发现的三条定律:处理深度是与数据量并列的 scaling 维度,格式切换的收益是比例调整的 8-60 倍,不同能力域的饱和速率可以差 4 倍以上。 1. 预训练数据工程为何被严重低估 Scaling law 文献集中在参数量与 token...
某 3B 模型训练到 Stage2 结束,例行检查参数分布时发现最后一层的 learnable scalar 从初始 1.0 漂移到了 56.25。但训练 loss 和所有评测指标完全没有任何异常。这个参数在”假装学习”——而且会在端侧 INT4 量化时致命。 这篇文章记录完整的排查过程:从发现现象、定位根因、理解数学原理,到三次修复尝试(两次失败),最终给出一个三文件改动的干净解。 ...