training 26
- multi_doc_qa 从 0.086 涨到 0.200: SWA + LowRank Gated + Hybrid RoPE 的长文配方
- SAM in Annealing: Loss Landscape Geometry Determines Quantization Robustness
- Format Switch 的收益是 Ratio 调整的 8-60 倍: daVinci-LLM 200 次消融揭示的预训练数据工程三大定律
- SwiftKV — KV Cache 跨层预测从预训练到 RL 的完整工程叙事
- KV Cache 砍 90%、推理提速 7x:六个正交架构创新如何叠加生效
- Token Superposition Training:2.5x 预训练加速但重新初始化 embedding 就翻车
- KV Cache 共享让文本榜单掉了 1.9%,但 RL 四轮迭代后反超 baseline 1.4%: 架构退化的 RL 补偿机制
- 81% Sparsity 只掉 0.48 分却快了 7 倍:从 Flash Attention 到训练时稀疏的 IO-Aware 全景
- 上线才发现的坑:Token Budget 设计、Function Calling 格式战争与 Proxy Metric 翻车
- Attention Residual 拿了 0.025 的 loss 收益, 但 PyTorch 实现慢了 90%: Triton Kernel 怎么把开销压到 14%
- Layer Scalar 不加 Weight Decay 漂到 56, 为什么 Bias 不加却安然无恙: 一个用具体数字说明的数学推导
- 新架构 34/35 验证集更好、ceval +2.67 pt, 但 iter-time 慢了 3.17 倍: 结构升级的效率代价决策
- Design Spec — 训推加速系列深化 9 篇(2026-05-08)
- Design Spec — 训推加速三新篇:精度对齐 / Gradient Checkpointing / CUDA Graph
- 训推加速 Qwen3 实战:看懂模型结构 + 识别算子融合机会
- 配置驱动的训练框架:从 YAML 到模块实例化的设计与实践
- LLM 训练显存估算全指南:从 ZeRO 到 MoE
- PyTorch Profiler 显存瓶颈分析全指南(实战版)
- 训练大模型时,优化器状态到底在吃多少显存
- 免费 GPU 或廉价算力
- 大语言模型高质量数据集汇总
- Embedding Model Fine-Tuning 案例
- 中文 Emebedding & Reranker 模型选型
- Embedding 模型在 RAG 场景下的评估和微调
- 大语言模型(LLM)后训练数据准备相关笔记
- 大语言模型(LLM)微调技术笔记