自部署 SearXNG 私有元搜索引擎:从零到 JSON API 可用的完整实战
背景与动机 日常技术调研需要频繁搜索 GitHub、Reddit、X (Twitter)、V2EX、Stack Overflow 等平台,但: 商业搜索引擎隐私成本高 — Google/Bing 每次搜索都在喂数据 AI 搜索(Perplexity 等)不透明 — 不知道它读了哪些源,也无法控制搜索范围 需要 JSON API — 后续接入本地 LLM 做 RAG 或 Ag...
背景与动机 日常技术调研需要频繁搜索 GitHub、Reddit、X (Twitter)、V2EX、Stack Overflow 等平台,但: 商业搜索引擎隐私成本高 — Google/Bing 每次搜索都在喂数据 AI 搜索(Perplexity 等)不透明 — 不知道它读了哪些源,也无法控制搜索范围 需要 JSON API — 后续接入本地 LLM 做 RAG 或 Ag...
一个真实的训练事故 某团队在一个 4B 参数的端侧模型上做 Tool-Integrated Reasoning (TIR) 的 GRPO 训练。任务是数学推理 + 代码解释器调用。训练配置如下: 模型: 4B dense, 32 layers, hidden 3072 RL 算法: GRPO, group_size=16, max_seq_len=32K 工具: Python code ...
开场:一个反直觉的实验结果 PLE 从 dP=64 扩到 dP=128,参数多花了 220M,loss 一丝不动——2.149→2.149。而从 128 跳到 256,突然降了 0.017。 这不是噪声。多次复现,结果稳定。某 3B 模型的 PLE scaling 曲线上,存在一个清晰的”死区”(dead zone):参数加了,但模型完全无感。这迫使我们重新审视一个假设——参数量与 lo...
某 4B Dense 模型想要推理加速——把后 16 层 FFN 换成 MoE。Scaling Law 估算的结论出人意料:1/8 激活比直接丢了 17-19% 性能(判死刑),即使 1/2 激活也要把总参数从 4B 扩到 5.2B(+28-33%)才能追平。这笔账到底该怎么算? 为什么只换”后半段”? 这个 4B Dense 模型的架构是 32 层、H=2560,但 FFN 维度并不均...
这篇文章给谁看 你是产品经理、运营、分析师——不会写代码,但: 你有一个 AI 编程助手(Claude Code / Cursor / Windsurf / Codex,任何一个都行) 你有一台境外云服务器(没有的话,AI 也能帮你买) 你想拥有一个完全属于自己的、无广告、无追踪、带 API 的搜索引擎 你要做的事只有两件:复制一段 Prompt 给 AI → 打开浏览...
某 1T 参数 MoE 模型训练中 loss spike 频繁出现。换了优化器之后,spike 频率直降 80%。核心 insight 极其简单:Router 梯度和 Expert 梯度的统计特性完全不同,不应该用同一个裁剪阈值。 这篇文章从优化器视角分析 MoE 训练不稳定性的根源,以及 MuonClip 如何通过三个针对性设计解决这个问题。 MoE 训练的三重不稳定性 MoE ...
某 3B 多模态模型的多教师蒸馏实验,统一用 T=6 做 caption 教师的温度,F1 涨了 0.029。第三天加入更多教师后,caption 质量突然掉了 0.985——”budget dilution” 让每个教师的信号都被稀释了。这篇文章记录从 uniform temperature 到 per-teacher adaptive temperature 的完整实验路径,以及为什么温...
开场:一个 962B 模型的训练噩梦 上个月我参与调试某 962B MoE 的训练稳定性问题,这个模型的配置如下: 78 layers, hidden size 6656, 512 experts, top-8 routing Active params 34.7B out of 962B total — 只有 3.6% 的激活比 采用 LatentMoE 架构:share...
通用 Scaling Law 说目标数据重复超过 4 轮就开始退化。我们在混合训练中发现完全不是这回事——目标数据可以重复 15-20 轮而不退化,前提是有通用数据持续注入”新鲜梯度”。这个发现来自 2000+ 次训练实验的 power-law 拟合。 “4-epoch 定律”以及它在混合训练中为什么不成立 2023 年的经典结论(Muennighoff et al.)清晰且简单:单一...
复盘:128K Eval 上 PPL 突然爆炸的定位过程 某 671B MoE 模型完成 14.8T tokens 主预训练后,第一次把序列长度从 4K 推到 32K 做 eval——PPL 从 7.2 飙到 142。位置编码完全没见过 >4K 的位置,外推失败是意料之中的。 工程团队的方案是 YaRN 扩展。但 YaRN 有几十个超参要配:scale、alpha、beta、tar...
大模型训练中,很多”诡异现象”其实都有干净的数学解释。本文分享三个我在实际训练中踩过的坑,每个都涉及一个容易被忽视的底层机制。它们的共同特点是:training loss 看起来完全正常,但模型已经在某个维度上悄悄劣化了。 1. Adam 优化器在零梯度参数上的单调漂移 现象 某 3B 模型训练结束后做 INT8 量化,发现最后一层 RMSNorm 的 learnable scal...
做 LLM 工程和做传统后端最大的区别在于:很多坑不会以 error 的形式出现,而是以”指标莫名下降 2 个点”的形式出现。 这篇文章汇总了我在生产环境中踩过的几类隐性陷阱,希望能帮你少走弯路。 1. Token Budget 是分类问题不是回归问题 很多人第一次设计 thinking budget 机制时,会本能地把它当作连续值回归 — 让模型自己决定”我要思考多少 token”...