metrics 11
- KL 散度、Cosine、Sim:大模型训练里的“相近”到底怎么量?一个数值实验告诉你它们有多不同
- MTP 白送 1.8x 加速、接受率还能当质量探针:从辅助 Loss 到推理加速的意外收获
- SWA + Gated Attention — Loss 降了 0.013 但窗口越小评测越差的反直觉实验
- 一个 Megatron flag 把多模态梯度稀释了 17 倍:--calculate-per-token-loss 的生产事故复盘
- 只在 Answer 上算 Loss、MTP λ=0.3 到底带来多少:从实验配置反推 Loss 设计的工程决策
- 蒸馏就是 RL、学生能超越老师:On-Policy Distillation 统一框架与六个落地范式
- 训推加速模型效果指标全景:客观指标 + 主观评价 + 加速退化信号
- 训推加速效率指标全景:吞吐 / 延迟 / MFU / TGS / SLO(含数学公式)
- 大语言模型(LLM)推理性能优化以及推理框架、后端的评测
- Embedding 模型在 RAG 场景下的评估和微调
- 中文模型 C-Eval 评测结果简单小评测