attention 25
- multi_doc_qa 从 0.086 涨到 0.200: SWA + LowRank Gated + Hybrid RoPE 的长文配方
- SWA + Gated Attention — Loss 降了 0.013 但窗口越小评测越差的反直觉实验
- RMSNorm scalar 漂移到 56 训练 Loss 却不动:Softmax 的量化照妖镜与温度调控术
- Sample Packing + Attention Masking:未定义变量减少 52.7% 的预训练工程细节
- 长文 Loss 突然涨了 0.004:一次 RoPE × SWA 的冲突复盘与位置编码扩展全解
- KV Cache 砍 90%、推理提速 7x:六个正交架构创新如何叠加生效
- SWA + Gated Attention loss 降了 0.013:从一个 3B 模型实验看 Attention 演化的工程选择
- seq_len 从 4K 推到 16K、CP=2 一开就慢了 20%:Ulysses Context Parallelism 的工程取舍全记录
- 81% Sparsity 只掉 0.48 分却快了 7 倍:从 Flash Attention 到训练时稀疏的 IO-Aware 全景
- 4K→1M 上下文扩展只用了 2000 步:三份真实长文训练配置的工程复盘
- 训练 Loss 不动但模型已坏?Adam 漂移、Softmax 饱和、梯度稀释三大隐形杀手
- Attention Residual 拿了 0.025 的 loss 收益, 但 PyTorch 实现慢了 90%: Triton Kernel 怎么把开销压到 14%
- 五次排除实验定位 Attention 门控最优解:Sink 无效、RoPE 反噬、小窗口翻车
- 5 个独立创新逐步叠加, 从 loss 1.966 到 1.882 追平 Qwen3-4B: 架构集成的工程叙事
- 视频 & 3D 扩散训推加速:Wan 2.2 / HunyuanVideo / VSA / Gaussian Splatting
- 训推加速技术地图:三维分类 + 全景图 + 决策流 + 大模型加速术语表
- 视频图像分割模型技术洞察与训练加速:SAM 2 / SAM 3 / Grounded-SAM / 视频 Mask 的 2024~2026 栈
- Moonshot Kimi 系列技术洞察:从 K1.5 到 K2.6 的架构、优化器、训推工程
- 图像 Diffusion 训推加速深化:FLUX / SD3 / DMD2 / SageAttention
- Qwen3-8B 下让 Gradient Checkpointing 收益最大化:选择性重算 + Pareto 曲线
- Qwen3-8B 下 CUDA Graph 的合理使用:训练 / 推理分场景 + 陷阱清单
- 训推加速 Qwen3 实战:从"调包"到手写 Triton Kernel(含 backward)
- vLLM v0.20 显存优化与推理加速实战指南
- vLLM v0.20 架构深度解析:双引擎、调度器、KV Cache 与分布式推理
- Transformer 前向流程与自注意力机制简述