llm 34
- 从 vanilla RoPE 到多模态 RoPE:位置编码的「解耦」之路
- KL 散度、Cosine、Sim:大模型训练里的“相近”到底怎么量?一个数值实验告诉你它们有多不同
- arXiv 论文分诊方法论:如何用 6 个维度 30 秒筛出一篇值得精读的论文
- Vocab 100K 吃掉模型 10% 参数:一个 Tokenizer 决策如何锁死后续所有训练
- SWA + Gated Attention — Loss 降了 0.013 但窗口越小评测越差的反直觉实验
- Sample Packing + Attention Masking:未定义变量减少 52.7% 的预训练工程细节
- 上线才发现的坑:Token Budget 设计、Function Calling 格式战争与 Proxy Metric 翻车
- 同样的数据重复 20 遍不过拟合?数据配比中那些反直觉的 Scaling Law
- Moonshot Kimi 系列技术洞察:从 K1.5 到 K2.6 的架构、优化器、训推工程
- 语音模型基础篇:用预训练 ASR 模型搞定语音识别(从 Wav2Vec2 到 Whisper 实战)
- Codex App & CLI 接入第三方 API Key 和 Base URL 实战指南
- Tailscale 家庭多设备与 VPS 组网:GPT 访问、出口节点与文件共享
- 大模型训推高质量社区、技术博客与资源索引
- NVIDIA Nsight Systems 瓶颈分析全指南(实战版)
- Transformer 前向流程与自注意力机制简述
- 深度学习中的矩阵运算与线性代数基础
- OpenClaw 思考
- 自主 Agent / 上下文工程资料索引
- Tinker RL 测试(含代码库)
- 免费 GPU 或廉价算力
- 大语言模型高质量数据集汇总
- AI Tech Blog
- DeepSeek R1 阅读清单
- Embedding Model Fine-Tuning 案例
- 中文 Emebedding & Reranker 模型选型
- Gemini Pro Vision 作为 表格 OCR 解决方案的简单测试
- 大语言模型(LLM)推理性能优化以及推理框架、后端的评测
- Embedding 模型在 RAG 场景下的评估和微调
- 实现基于 Github Issues 的博客
- 大语言模型(LLM)学习路径和资料汇总
- 中文模型 C-Eval 评测结果简单小评测
- 大语言模型(LLM)后训练数据准备相关笔记
- 值得关注的对中文支持较好的开源模型
- 大语言模型(LLM)微调技术笔记