语音模型预处理流程及常用术语详解:从声波到 Log-Mel 到 Audio-LLM
为什么要专门写一篇”预处理 + 术语表” 开源语音模型(Whisper / Conformer / Paraformer / SenseVoice / Qwen2-Audio)的配置文件里动辄出现 n_mels=80、hop_length=160、win_length=400、sample_rate=16000、fbank、CMVN、SpecAugment、frame shift 这些名词...
为什么要专门写一篇”预处理 + 术语表” 开源语音模型(Whisper / Conformer / Paraformer / SenseVoice / Qwen2-Audio)的配置文件里动辄出现 n_mels=80、hop_length=160、win_length=400、sample_rate=16000、fbank、CMVN、SpecAugment、frame shift 这些名词...
姊妹篇:高效 CLI 工具栈 · GPU/NCCL 侧 SOP · Python CPU 侧 SOP 前面三篇讲”定位问题 + 调参”,这篇开始讲“读懂模型 + 改模型”:从 Qwen3 的源码和 profile 里识别算子融合机会。下篇讲”如果现成的 fusion 库也不够,怎么自己写 Triton kernel”。 零、本文骨架 小节 ...
1. 系列定位 两篇姊妹篇,延续训推加速 playbook: 前 4 篇:CLI toolkit / GPU SOP / CPU SOP / Speech 三部曲 本系列新增 2 篇,把”训推加速”从”定位问题 + 调参”推进到”理解模型结构 + 自己写 kernel” 两篇均以 Qwen3 系列为 standing example(当前最主流开源中文模型)。 2. 读者...
这是”训推加速三部曲”的 CPU 侧补完: 高效 CLI 工具栈 —— 讲工具 训推加速问题定位 SOP (GPU/NCCL 侧) —— 讲 CUDA kernel / NCCL / torch.compile 本篇 —— 讲系统 RAM OOM / numpy / GIL / asyncio / DataLoader / IO 做训推的人经常”G...
先安利一个工具:HoudahSpot + Raycast 在讲方法论之前,先推荐一个我用下来真心觉得 Powerful 的 macOS 工具——HoudahSpot。 它本质上是 Spotlight 的超集,但把 Spotlight 隐藏的能力全部释放出来了: 布尔 + 元数据组合查询:kind:pdf AND author:"Tiago Forte" AND created:&...
状态:WIP。这篇是调研笔记,不是完整教程。结论很快就到:Free Plan 能配置,但 Agent / Composer / Edit 都跑不动,只有 Ask 聊天模式可用。下面把坑列清楚,给有同样诉求的同学少踩几次。 相关背景:本站 Claude Code CLI 第三方网关、Codex CLI 第三方网关。 本文所有”网关域名”都用 https://gateway.exam...
TL;DR OpenAI Codex CLI + Codex 桌面 App 都支持任意 OpenAI Responses API 兼容的网关,通过 ~/.codex/config.toml 的 [model_providers.<id>] 自定义即可。最简场景只改一行 openai_base_url 就能把 built-in openai provider 指向代理;复杂场景可...
TL;DR Claude Desktop for Mac(v1.4758.0 起)支持接入任意 Anthropic Messages 兼容的网关,通过 Developer Mode 下的 “Configure Third-Party Inference” 窗口配置即可。全程不需要 Anthropic 官方账号。本文以接入本地自建网关 BlueRouter(http://127.0.0.1:...
TL;DR Claude Code CLI 支持任意 Anthropic Messages 协议兼容的网关,只需要两个环境变量 ANTHROPIC_BASE_URL + ANTHROPIC_API_KEY,或者写到 ~/.claude/settings.json 的 env 段里持久化。全程不需要 Anthropic 官方账号登录。本文覆盖四种配置方式、优先级顺序、多账号切换、以及几个常见...
引子 部署大模型时,工程师面对的核心矛盾始终是:显存不够用和推理速度不够快。vLLM v0.20 在这两个维度上提供了系统性的工具箱——从 KV Cache 量化、PagedAttention、前缀缓存,到 CUDA Graph、torch.compile 融合、投机解码,每一层都有可调旋钮。 本文基于 vLLM v0.20 源码,系统梳理各项优化手段、原理与 CLI 用法,帮助工程师快...
引子 vLLM 是目前生产环境中最广泛使用的大模型推理框架之一。v0.20 版本在保持向后兼容的同时,将主力执行路径完全迁移到了全新的 V1 引擎——进程分离架构、ZMQ IPC 通信、全新调度器。 本文基于 vLLM v0.20 源码,系统梳理其整体架构、数据流、核心组件和高级特性,帮助工程师快速建立完整的架构心智模型。 一、顶层目录结构 vllm_0_20/ ├── vllm...
问题背景 用 Hermes Agent 跑自动化任务时,它会对”危险命令”(rm -rf、git push --force、docker 等)弹出确认提示,要手动 approve 才能继续。单次交互场景还好,但在自动化 pipeline 或高频调试环境里,这种中断极其烦人。 光改一两个配置项不够——Hermes 的审批系统有多层控制,必须全部关闭才能真正实现 YOLO。 审批系统的...