Qian, Cheng

Stash Availability Check Tiles:一键检测 AI 与流媒体服务可用性

切换代理节点后,最常见的问题是”这个节点能用 ChatGPT 吗?Netflix 解锁了吗?”。每次手动打开浏览器逐个测试太麻烦,于是我基于 StashNetworks/misc 的 collapsed-tiles 机制,Vibe Coding 开发了一套覆盖主流 AI 服务和流媒体的一键检测磁贴,安装后直接在 Stash 首页折叠展示各服务的可用状态。 项目地址:pengyanai/mi...

Apple 子域名功能梳理与代理规则配置指南

Apple 生态中大量系统级服务依赖特定子域名通信,了解这些域名的功能归属,有助于在 Stash / Surge 等代理工具中精准编写分流规则,避免误拦截或漏放。本文按服务分组梳理关键域名及其用途,并给出可直接使用的规则片段。 一、GeoServices 地理服务 (ls.apple.com) 地理服务是 Apple 地图、天气、新闻、Spotlight 等多个系统功能的底层依赖,所...

Tailscale 家庭多设备与 VPS 组网:GPT 访问、出口节点与文件共享

本文基于 Tailscale 官方文档与社区(GitHub、Reddit、知乎及中文博客)的实践,梳理家庭多设备(iPhone/iPad、家中 M1 Mac mini、海外 VPS)组网时,如何配置出口节点访问海外 GPT、子网路由打通家庭内网,以及网络与文件共享,并说明连接原理与可选加速手段。 目录 场景与目标 Tailscale 核心概念速览 网络与连接原理 角色与...

配置驱动的训练框架:从 YAML 到模块实例化的设计与实践

本文基于对某内部大模型训练框架的研读,梳理其如何通过 YAML 配置驱动从入口到各模块实例化的完整流程,并总结可复用的设计要点与扩展方式。内容已做脱敏,不涉及具体厂商与路径信息。 目录 要解决的问题 整体流程概览 从 Train 入口到各模块实例化的序列图 为什么能配置「项目外的类」 关键技术点与关键代码 配置与代码的对应关系 目录与模块结构 设计上的可...

PyTorch Profiler 显存瓶颈分析全指南(实战版)

本文聚焦PyTorch训练/推理场景下的显存瓶颈根因定位,基于PyTorch Profiler官方原生能力,提供从底层原理、全流程实操、典型案例分析到优化落地的完整闭环方案。重点覆盖forward逐层扶梯型显存占用分析、memory dump可视化诊断、梯度检查点(Gradient Checkpointing)优化验证等核心实战场景,所有代码与步骤均可直接复现。 一、前置基础:PyTorc...

PyTorch Profiler 瓶颈分析全指南(实战版)

在深度学习模型训练与推理(下称“训推”)过程中,性能瓶颈是制约开发者效率、模型部署落地的核心痛点——训练场景中,常出现GPU利用率长期低迷、单个epoch耗时远超预期、训练周期冗长等问题;推理场景下,则可能面临延迟超标、吞吐量不足、资源占用过高,无法满足生产环境高并发需求等困境。PyTorch Profiler作为PyTorch官方内置的专业性能分析工具,无需额外安装复杂依赖,能够精准捕获C...

NVIDIA Nsight Systems 瓶颈分析全指南(实战版)

在深度学习训练、CUDA 程序优化过程中,性能瓶颈排查是核心环节。NVIDIA Nsight Systems 作为专业的性能分析工具,可直观呈现 GPU/CPU/通信/数据 pipeline 全链路时序,快速定位各类性能瓶颈。本文整合实战经验,从瓶颈分类、图表特征、快速识别、速查工具四个维度,帮你高效掌握 Nsight Systems 瓶颈分析技巧,零基础也能快速上手。 一、核心瓶颈分类及...