Archives
- 10 Aug 从 vanilla RoPE 到多模态 RoPE:位置编码的「解耦」之路
- 10 Aug DMD → DMD2:扩散模型一步蒸馏,从分布匹配到超越教师
- 10 Aug KL 散度、Cosine、Sim:大模型训练里的“相近”到底怎么量?一个数值实验告诉你它们有多不同
- 07 Aug arXiv 论文分诊方法论:如何用 6 个维度 30 秒筛出一篇值得精读的论文
- 17 Jun GitHub 搜索高级技巧:Web UI、URL 拼接与 REST API 全指南
- 10 Jun Visual PLE 五种方法全军覆没:NTP-only 范式下自监督闭环缺失的完整诊断
- 10 Jun multi_doc_qa 从 0.086 涨到 0.200: SWA + LowRank Gated + Hybrid RoPE 的长文配方
- 10 Jun SAM in Annealing: Loss Landscape Geometry Determines Quantization Robustness
- 10 Jun MoE 做 RL 训练时 Routing 决策飘了:一个零成本的 Replay 方案消除了精度不一致
- 10 Jun up_proj 和 gated_proj 共享权重减 50% FFN 参数: 16 个验证集全部退化的干净失败
- 10 Jun Format Switch 的收益是 Ratio 调整的 8-60 倍: daVinci-LLM 200 次消融揭示的预训练数据工程三大定律
- 10 Jun RMSNorm 后的 Layer Scalar 漂移到 56 但训练 Loss 纹丝不动:一个 Adam 优化器的隐形 Bug
- 10 Jun MTP 白送 1.8x 加速、接受率还能当质量探针:从辅助 Loss 到推理加速的意外收获
- 10 Jun Activation Recomputation 不是免费午餐:recompute 24 层 vs 16 层导致 loss 显著偏高
- 10 Jun Grad-norm 一直 0.21 突然飙到 50:从真实训练日志看梯度工程的六个生死细节
- 10 Jun Embedding 占了模型 10% 参数却只做查表:从 tie-embeddings=yes 到 PLE 的工程演化
- 10 Jun Vocab 100K 吃掉模型 10% 参数:一个 Tokenizer 决策如何锁死后续所有训练
- 10 Jun SwiftKV — KV Cache 跨层预测从预训练到 RL 的完整工程叙事
- 10 Jun SWA + Gated Attention — Loss 降了 0.013 但窗口越小评测越差的反直觉实验
- 10 Jun RMSNorm scalar 漂移到 56 训练 Loss 却不动:Softmax 的量化照妖镜与温度调控术
- 10 Jun Sample Packing + Attention Masking:未定义变量减少 52.7% 的预训练工程细节
- 10 Jun 长文 Loss 突然涨了 0.004:一次 RoPE × SWA 的冲突复盘与位置编码扩展全解
- 10 Jun 一个 Megatron flag 把多模态梯度稀释了 17 倍:--calculate-per-token-loss 的生产事故复盘
- 10 Jun Loss Spike 频率降了 80%:从 Adam 到 MuonClip,万亿参数 MoE 的优化器进化实战
- 10 Jun 只在 Answer 上算 Loss、MTP λ=0.3 到底带来多少:从实验配置反推 Loss 设计的工程决策
- 10 Jun 蒸馏就是 RL、学生能超越老师:On-Policy Distillation 统一框架与六个落地范式
- 10 Jun KV Cache 砍 90%、推理提速 7x:六个正交架构创新如何叠加生效
- 10 Jun 为什么多模态训练不要 Warmup:从四份真实 LR 配置看学习率调度的工程哲学
- 10 Jun SWA + Gated Attention loss 降了 0.013:从一个 3B 模型实验看 Attention 演化的工程选择
- 10 Jun seq_len 从 4K 推到 16K、CP=2 一开就慢了 20%:Ulysses Context Parallelism 的工程取舍全记录
- 10 Jun Token Superposition Training:2.5x 预训练加速但重新初始化 embedding 就翻车
- 10 Jun KV Cache 共享让文本榜单掉了 1.9%,但 RL 四轮迭代后反超 baseline 1.4%: 架构退化的 RL 补偿机制
- 10 Jun SwiftKV 预测 12 层 loss 最低, 但最终选了 16 层: 端侧首词提速 35% 的工程决策
- 10 Jun 接受率从 0% 调到 90%:MTP 投机解码的工程调优全记录与 Drafter 质量诊断
- 10 Jun 把 point 当普通文本训练, UIAgent 指标直接崩了: 多模态 Special Token 的隐形碰撞
- 10 Jun 81% Sparsity 只掉 0.48 分却快了 7 倍:从 Flash Attention 到训练时稀疏的 IO-Aware 全景
- 10 Jun 自部署 SearXNG 私有元搜索引擎:从零到 JSON API 可用的完整实战
- 10 Jun GRPO 训了 3 天模型反而不调工具了:Tool Use RL 的 Interaction Collapse 与六个结构性修复
- 10 Jun PLE 参数扩展的死区现象:为什么 dP=64→128 完全不降 loss
- 10 Jun Partial MoE Scaling Law: 后16层换MoE、1/8激活比丢了17-19%性能的真实代价
- 10 Jun 不写一行代码,用 AI Agent 10 分钟搭建你的私人搜索引擎
- 10 Jun Router 梯度和 Expert 梯度分开裁剪, Loss Spike 频率降了 80%: MoE 训练稳定性的优化器视角
- 10 Jun 多教师蒸馏的温度工程:从 T=1 到 per-teacher adaptive temperature 的实验叙事
- 10 Jun 512 Expert 里 80% 是死的:从 MuonClip 到 Expert Upcycling,MoE 训练稳定性的三个生死问题
- 10 Jun 目标数据重复 15-20 遍不过拟合:混合训练的 Scaling Law 推翻了'4 epoch 定律'
- 10 Jun 4K→1M 上下文扩展只用了 2000 步:三份真实长文训练配置的工程复盘
- 10 Jun 训练 Loss 不动但模型已坏?Adam 漂移、Softmax 饱和、梯度稀释三大隐形杀手
- 10 Jun 上线才发现的坑:Token Budget 设计、Function Calling 格式战争与 Proxy Metric 翻车
- 10 Jun 同样的数据重复 20 遍不过拟合?数据配比中那些反直觉的 Scaling Law
- 10 Jun 7B 模型重复 8 次只保留 25% 有效信息, 400M 保留 50%: 大模型比小模型对数据重复更敏感
- 10 Jun 30 条数据 + GRPO 就能涨 10 分:2025-2026 RL for LLM 的算法选型与框架实战
- 10 Jun CoLA 说参数减 45% 不掉点,我们的 3B 实验说 6.85T tokens 才能追平:一个精确的负面结果
- 10 Jun CoLA 放在 up_proj 收敛快 2.3 倍: FFN 内部低秩最优落点的定位实验
- 10 Jun Attention Residual 拿了 0.025 的 loss 收益, 但 PyTorch 实现慢了 90%: Triton Kernel 怎么把开销压到 14%
- 10 Jun Layer Scalar 不加 Weight Decay 漂到 56, 为什么 Bias 不加却安然无恙: 一个用具体数字说明的数学推导
- 10 Jun 五次排除实验定位 Attention 门控最优解:Sink 无效、RoPE 反噬、小窗口翻车
- 10 Jun 新架构 34/35 验证集更好、ceval +2.67 pt, 但 iter-time 慢了 3.17 倍: 结构升级的效率代价决策
- 10 Jun 5 个独立创新逐步叠加, 从 loss 1.966 到 1.882 追平 Qwen3-4B: 架构集成的工程叙事
- 01 Jun 普通人如何用好 Claude 协作办公:开发环境优化实战
- 12 May 跨区迁移 EC2 + 一条命令把自己 SSH 踢出门:Ubuntu 24.04 socket activation 踩坑全程
- 10 May Tailscale 接家里 NAS 踩坑全记录:SSH 免密 / DERP / NAT 打洞 / Peer Relay
- 10 May 给 NAS 做一次"体检":Btrfs 压缩、scrub 排程与 SSD 缓存审计
- 10 May 家用 NAS 从裸奔到合规:12 项风险的完整审计与加固
- 10 May 一次重启引发的血案:SATA 瞬断如何拖垮 RAID / scemd / synopkg
- 10 May RAID (E) 标记与 volume2 只读:一次 SATA 物理层雪崩的复盘
- 10 May Cloud Sync 静默丢文件:一个 NFD/NFC 编码踩出的坑
- 10 May 家庭 NAS 翻墙实战:GFW 连通性审计 + mihomo 分层代理
- 10 May 家用 NAS 进阶路线图:Python API + Docker 生态 + 自托管清单
- 10 May Docker 镜像加速站 2026 实测:14 站还剩几家能用?
- 08 May 水印消除 / 图像编辑模型训练加速:Inpainting / Instruct-Edit / Flux Fill 的 2024~2026 栈
- 08 May 视频 & 3D 扩散训推加速:Wan 2.2 / HunyuanVideo / VSA / Gaussian Splatting
- 08 May 训推加速模型效果指标全景:客观指标 + 主观评价 + 加速退化信号
- 08 May Design Spec — 训推加速系列深化 9 篇(2026-05-08)
- 08 May 训推加速效率指标全景:吞吐 / 延迟 / MFU / TGS / SLO(含数学公式)
- 08 May 训推加速技术地图:三维分类 + 全景图 + 决策流 + 大模型加速术语表
- 08 May Tailscale VPS Exit Node 实战:自定义 UDP 端口 + UDP GRO 调优 + DNS 防泄漏
- 08 May 语音 / 音频模型加速新常识:从 Audio Tokenizer 到 Full-duplex 对话
- 08 May Speculative Decoding 实战:vLLM 框架下 EAGLE-3 原理与工程落地
- 08 May 视频图像分割模型技术洞察与训练加速:SAM 2 / SAM 3 / Grounded-SAM / 视频 Mask 的 2024~2026 栈
- 08 May 机器人 VLA 训推加速:OpenVLA / π0 / RDT-1B / GR00T 的实时控制工程
- 08 May RL 训练加速实战:Qwen3.5 + vLLM + veRL 的 fully-async 架构
- 08 May 音乐生成加速:Suno / MusicLM / UniAudio / Stable Audio
- 08 May MoE 训练加速实战:DeepEP + Grouped GeMM + Aux-Loss-Free 的 Qwen3.5 配方
- 08 May MoE 教师 → Dense 学生:2024~2026 开源社区的落地范式
- 08 May Moonshot Kimi 系列技术洞察:从 K1.5 到 K2.6 的架构、优化器、训推工程
- 08 May 图像 Diffusion 训推加速深化:FLUX / SD3 / DMD2 / SageAttention
- 08 May Qwen3-8B 下让 Gradient Checkpointing 收益最大化:选择性重算 + Pareto 曲线
- 08 May 替换 Fused Kernel 后如何对齐训推精度:7 类差异来源 + 3 道验证 Gate + 8 个实战技巧
- 08 May 端侧多模态端到端加速:MiniCPM-o / Gemma 3n / Qwen3-Omni
- 08 May Qwen3-8B 下 CUDA Graph 的合理使用:训练 / 推理分场景 + 陷阱清单
- 07 May 训推加速 Qwen3 实战:从"调包"到手写 Triton Kernel(含 backward)
- 07 May 训推工程师 & AI Agent 时代的高效 CLI 工具栈:从 zoxide 到 nvitop 到 Claude Code
- 07 May 训推加速问题定位 SOP 与 Know-how:从 GPU 低利用率到 NCCL hang 到推理吞吐
- 07 May Design Spec — 训推加速三新篇:精度对齐 / Gradient Checkpointing / CUDA Graph
- 07 May 语音识别模型架构演进:从 HMM-GMM 到 Whisper 到 Qwen3-ASR
- 07 May 语音模型基础篇:用预训练 ASR 模型搞定语音识别(从 Wav2Vec2 到 Whisper 实战)
- 07 May 语音模型预处理流程及常用术语详解:从声波到 Log-Mel 到 Audio-LLM
- 07 May 训推加速 Qwen3 实战:看懂模型结构 + 识别算子融合机会
- 07 May Design Spec — 训推加速系列:看懂 Qwen3 + Fusion 识别 + Triton 实战
- 07 May 训推加速 Python 侧排障 SOP:OOM / GIL / asyncio / DataLoader / IO
- 07 May 工程师的 Downloads 目录整理方法论:PARA + 时间线 + 工程实践
- 07 May Cursor Free Plan 接入第三方 BlueRouter 网关调研(WIP)
- 07 May Codex App & CLI 接入第三方 API Key 和 Base URL 实战指南
- 07 May Claude Desktop for Mac 配置第三方 API Key 和 Base URL 完整指南
- 07 May Claude Code CLI 接入第三方 API Key 和 Base URL 实战指南
- 30 Apr vLLM v0.20 显存优化与推理加速实战指南
- 30 Apr vLLM v0.20 架构深度解析:双引擎、调度器、KV Cache 与分布式推理
- 30 Apr Hermes Agent 完全 YOLO 模式:彻底关掉「approve this command?」确认框
- 30 Apr Hermes Update 冲突排查:本地 Xiaomi MIMO 补丁的保全与重放
- 29 Apr AI Coding Agent 的多 Agent 协作架构深度调研:从 Claude Code 到 Hermes Agent
- 27 Apr Stash Availability Check Tiles:一键检测 AI 与流媒体服务可用性
- 27 Apr 大陆高速访问 GitHub 资源:jsDelivr CDN 拼接技巧与镜像实测
- 27 Apr Apple 子域名功能梳理与代理规则配置指南
- 03 Mar Tailscale 家庭多设备与 VPS 组网:GPT 访问、出口节点与文件共享
- 02 Mar 配置驱动的训练框架:从 YAML 到模块实例化的设计与实践
- 27 Feb 大模型训推高质量社区、技术博客与资源索引
- 26 Feb LLM 训练显存估算全指南:从 ZeRO 到 MoE
- 26 Feb PyTorch Profiler 显存瓶颈分析全指南(实战版)
- 26 Feb PyTorch Profiler 瓶颈分析全指南(实战版)
- 26 Feb NVIDIA Nsight Systems 瓶颈分析全指南(实战版)
- 25 Feb 中国营销中的央视平台投放:ROI分析、文化心理与洞察
- 25 Feb 让 GPT 帮你从零梳理需求,最后产出一份高质量 Context Prompt 的实践笔记
- 12 Feb Cursor 模型与 Pro 额度的实战调研记录
- 11 Feb Transformer 前向流程与自注意力机制简述
- 11 Feb 深度学习中的矩阵运算与线性代数基础
- 05 Feb OpenClaw 思考
- 15 Jan 训练大模型时,优化器状态到底在吃多少显存
- 04 Jan 自主 Agent / 上下文工程资料索引
- 25 Dec Tinker RL 测试(含代码库)
- 23 Sep LLM 量化(GPTQ、GGUF)实战以及效果和推理性能实测
- 16 Sep 使用Coding Agent 作为通用智能体完成 DeepResearch 任务
- 09 Sep 不同硬件和推理引擎模型输出的精度差异
- 03 Sep 免费 GPU 或廉价算力
- 10 Jul 大语言模型高质量数据集汇总
- 08 Jul AI Tech Blog
- 29 Jan DeepSeek R1 阅读清单
- 28 Dec 中文 Emebedding & Reranker 模型选型
- 20 Dec Gemini Pro Vision 作为 表格 OCR 解决方案的简单测试
- 19 Dec 大语言模型(LLM)推理性能优化以及推理框架、后端的评测
- 04 Nov Embedding 模型在 RAG 场景下的评估和微调
- 06 Jul How to Check Charging Power (Watts) on macOS
- 28 Jun 实现基于 Github Issues 的博客
- 27 Jun 大语言模型(LLM)学习路径和资料汇总
- 27 Jun 中文模型 C-Eval 评测结果简单小评测
- 26 Jun 大语言模型(LLM)后训练数据准备相关笔记
- 21 Jun 值得关注的对中文支持较好的开源模型
- 12 May 大语言模型(LLM)微调技术笔记