Hermes Update 冲突排查:本地 Xiaomi MIMO 补丁的保全与重放
背景 hermes update 拉取了 1150 个新 commit 之后,本地针对 Xiaomi MIMO 的两处兼容补丁产生冲突,需要手动处理。 这不是一次偶然——只要维护了任何本地 hack,每次大版本 update 就可能触发。本文记录根因、解法,以及如何让补丁在下次更新后不再丢失。 冲突根因 本地有两处 MIMO 兼容改动: 文件 ...
背景 hermes update 拉取了 1150 个新 commit 之后,本地针对 Xiaomi MIMO 的两处兼容补丁产生冲突,需要手动处理。 这不是一次偶然——只要维护了任何本地 hack,每次大版本 update 就可能触发。本文记录根因、解法,以及如何让补丁在下次更新后不再丢失。 冲突根因 本地有两处 MIMO 兼容改动: 文件 ...
引子 2025 年底到 2026 年初,AI Coding Agent 进入了一个新的阶段——单 Agent 不够用了。当任务复杂度超过单个 Agent 的上下文窗口和推理能力时,”让多个 Agent 协同工作”成为必然选择。 本文基于对 Claude Code、OpenAI Codex CLI、OpenCode、Hermes Agent 等主流 Coding Agent 的实际使用和源...
切换代理节点后,最常见的问题是”这个节点能用 ChatGPT 吗?Netflix 解锁了吗?”。每次手动打开浏览器逐个测试太麻烦,于是我基于 StashNetworks/misc 的 collapsed-tiles 机制,Vibe Coding 开发了一套覆盖主流 AI 服务和流媒体的一键检测磁贴,安装后直接在 Stash 首页折叠展示各服务的可用状态。 项目地址:pengyanai/mi...
raw.githubusercontent.com 在大陆经常超时或被 SNI 阻断。本文记录通过 jsDelivr 及其多个子域名/镜像,在不挂代理的情况下高速拉取 GitHub 仓库中的静态资源(配置文件、图片、JS 脚本等)的实践。 一、URL 拼接通用格式 jsDelivr 提供 GitHub 资源的 CDN 加速,统一格式为: https://{host}/gh/{use...
Apple 生态中大量系统级服务依赖特定子域名通信,了解这些域名的功能归属,有助于在 Stash / Surge 等代理工具中精准编写分流规则,避免误拦截或漏放。本文按服务分组梳理关键域名及其用途,并给出可直接使用的规则片段。 一、GeoServices 地理服务 (ls.apple.com) 地理服务是 Apple 地图、天气、新闻、Spotlight 等多个系统功能的底层依赖,所...
本文基于 Tailscale 官方文档与社区(GitHub、Reddit、知乎及中文博客)的实践,梳理家庭多设备(iPhone/iPad、家中 M1 Mac mini、海外 VPS)组网时,如何配置出口节点访问海外 GPT、子网路由打通家庭内网,以及网络与文件共享,并说明连接原理与可选加速手段。 目录 场景与目标 Tailscale 核心概念速览 网络与连接原理 角色与...
本文基于对某内部大模型训练框架的研读,梳理其如何通过 YAML 配置驱动从入口到各模块实例化的完整流程,并总结可复用的设计要点与扩展方式。内容已做脱敏,不涉及具体厂商与路径信息。 目录 要解决的问题 整体流程概览 从 Train 入口到各模块实例化的序列图 为什么能配置「项目外的类」 关键技术点与关键代码 配置与代码的对应关系 目录与模块结构 设计上的可...
大模型训练与推理相关的高质量社区、技术博客、官方资源索引。按类型分类,表格形式便于快速查阅。 一、厂商 / 研究院官方博客 来源 链接 侧重 NVIDIA Technical Blog developer.nvidia.com/blog GPU 训练、Tenso...
本文是我在研究 LLM 训练显存开销过程中的系统性梳理,从 ZeRO 论文的 16 Φ bytes/param 公式出发,逐步拆解激活值、DataLoader、冻结层、LoRA,最后延伸到 MoE 架构的特殊性。每一部分都尽量给出可量化的公式和真实 case,方便直接用于工程估算。 一、基础:ZeRO 的 16 bytes/param 从何而来 ZeRO 论文的核心研究问题是:...
本文聚焦PyTorch训练/推理场景下的显存瓶颈根因定位,基于PyTorch Profiler官方原生能力,提供从底层原理、全流程实操、典型案例分析到优化落地的完整闭环方案。重点覆盖forward逐层扶梯型显存占用分析、memory dump可视化诊断、梯度检查点(Gradient Checkpointing)优化验证等核心实战场景,所有代码与步骤均可直接复现。 一、前置基础:PyTorc...
在深度学习模型训练与推理(下称“训推”)过程中,性能瓶颈是制约开发者效率、模型部署落地的核心痛点——训练场景中,常出现GPU利用率长期低迷、单个epoch耗时远超预期、训练周期冗长等问题;推理场景下,则可能面临延迟超标、吞吐量不足、资源占用过高,无法满足生产环境高并发需求等困境。PyTorch Profiler作为PyTorch官方内置的专业性能分析工具,无需额外安装复杂依赖,能够精准捕获C...
在深度学习训练、CUDA 程序优化过程中,性能瓶颈排查是核心环节。NVIDIA Nsight Systems 作为专业的性能分析工具,可直观呈现 GPU/CPU/通信/数据 pipeline 全链路时序,快速定位各类性能瓶颈。本文整合实战经验,从瓶颈分类、图表特征、快速识别、速查工具四个维度,帮你高效掌握 Nsight Systems 瓶颈分析技巧,零基础也能快速上手。 一、核心瓶颈分类及...