
音频不离开硬盘Audacity 的 OpenVINO AI 插件把5个模型搬进本地【免费下载链接】openvino-plugins-ai-audacityA set of AI-enabled effects, generators, and analyzers for Audacity®.项目地址: https://gitcode.com/gh_mirrors/op/openvino-plugins-ai-audacity如今提到AI 处理音频大多数人第一反应是找个网页、上传文件、等云端排队。而这个项目恰好反着来Audacity AI插件仓库名 openvino-plugins-ai-audacity把音乐分离、语音转录、噪声抑制、音乐生成、音频超分辨率这5类模型全部装进本地断网也能用音频数据全程不离开你的硬盘。它基于 Intel 的 OpenVINO 推理框架能调用你机器上的 CPU、GPU、NPU。适合不想把录音上传云端的人、网络不稳定的环境以及一切想免费给 Audacity 加AI 外挂的用户。这篇不按功能清单念而是按你拿到手之后的真实探索顺序来讲先弄懂它凭什么能在本地跑这些大模型再完成启用模块这第一道坎然后逐个摸清参数最后带走几个别人踩过的坑。本地跑大模型凭的是什么先做个对比云端音频工具的好处是零安装代价是你的素材要过一道别人的服务器。对采访录音、医疗语音、商业演示这类内容来说上传本身就是一个风险。这个插件选择的路线是把推理层整个搬到本地功夫主要花在移植上音乐分离用的是 Meta 的 Demucs v4htdemucs模型被转成 OpenVINO IR 格式htdemucs_v4.xml / .bin语音转录基于 OpenAI 的 Whisper跑在 whisper.cpp 之上并启用 OpenVINO 后端噪声抑制支持 DeepFilterNet2、DeepFilterNet3另保留了一个 legacy 的 denseunet 模型音乐生成用 MusicGen-Small 与 MusicGen-Small-Stereo单声道/立体声两版输出均为 32kHz超分辨率移植自 versatile_audio_super_resolutionAudioSR能把音频提升到 24kHz 带宽、48kHz 采样率。这些管线大多原本是 python PyTorch 写的项目把它们重写成 C模型也转换成 OpenVINO 的中间表示。这才是本地跑的关键OpenVINO 会根据你选的设备把模型即时编译成对应指令集CPU 能跑、GPU 能加速、部分平台还能用 NPU。想验证这一点直接翻源码——模型相关代码集中在 mod-openvino/五个功能各自的参数说明在 doc/feature_doc/。动手之前先记一张入口表5个功能在 Audacity 里的位置并不一样功能菜单位置背后模型音乐分离效果 → OpenVINO AI EffectsDemucs v4噪声抑制效果 → OpenVINO AI EffectsDeepFilterNet2/3音乐生成生成Generate菜单MusicGen-Small语音转录分析Analyze菜单Whisperwhisper.cpp音频超分效果Effect菜单AudioSR装上之后的第一道坎把模块从 New 改成 Enabled安装方式分平台。Windows 用户直接拿发布页的安装包Linux 最简单的路子是装 Audacity 的 snap 包它开箱自带 OpenVINO 模块支持sudo snap install audacity想用 GPU/NPU 加速把自己加进 render 组再装 intel-npu-driver 这个 snap。模型并不内置在 snap 里装完跑一条命令批量拉取sudo audacity.fetch-models --batch源码党也有完整构建文档doc/build_doc/windows/README.md 和 doc/build_doc/linux/README.md以 Ubuntu 22.04 为例。手动构建需要额外准备 OpenVINO 2024.6、OpenVINO Tokenizers、libtorch 2.4.1、OpenCL并先编译带 OpenVINO 后端的 whisper.cpp。源码在git clone https://gitcode.com/gh_mirrors/op/openvino-plugins-ai-audacity无论哪种方式装完后都有一道必做的操作也是最容易卡住的一步打开 编辑 → 首选项 → 模块你会看到 mod-openvino 的状态是 New必须手动改成 Enabled保存后重启 AudacityAI 菜单才会出现。打开效果菜单第一个值得试的是音乐分离重启之后从 效果 → OpenVINO AI Effects → OpenVINO Music Separation 进入。菜单里音乐分离、噪声抑制等功能并列排在 OpenVINO AI Effects 子菜单下。弹出的参数对话框只需要你决定两件事分离成几轨、跑在哪个设备上。Separation Mode分离模式2-Stem 出两轨伴奏 人声4-Stem 出四轨鼓、贝斯、其他乐器、人声。做卡拉OK伴奏选 2-Stem 就够。OpenVINO Inference Device推理设备CPU 兼容性最好有独显就选 GPU速度优势明显。旁边的 Device Details 按钮会列出设备映射多 GPU 时能看清哪个是 GPU.0、哪个是 GPU.1。Shifts进阶选项这个效果会带着随机位移把 htdemucs 管线跑 N 遍再合成。数值越高可能越好但耗时随数值线性增长——1 用来快速预览日常用 2出成品再上 3–4。点 Apply 后首次加载会有 10~30 秒停顿这是模型在针对你选的设备即时编译编译结果会缓存到磁盘第二次加载明显变快。跑完工作区会出现带后缀的新轨道-Drums、-Bass、-Vocals、-Other Instruments一眼分清。每条分离轨道都是 32-bit float 立体声可以继续独立做 EQ、压缩再混回原工程。转录和降噪参数藏在细节里Whisper 转录从 base 到 large 的取舍入口在 分析 → OpenVINO Whisper Transcription。它产出的不是新音频而是一条标签轨道——文字带时间戳对齐到波形能直接当字幕底稿。值得改的参数有三个Whisper Modelbase 最快、效果够用源语言不是英语时建议上 small 或 medium追求准确率用 largev1/v2/v3。模型在安装时选择下载。Modetranscribe 按源语言输出translate 强制转成英语多语言素材做本地化时直接用。Source Language默认 auto 自动检测也可以手动指定。两个进阶参数同样实用Initial Prompt 可以写进人名、缩写等上下文明显提升识别准确率Max Segment Length 设成 1 时输出词级时间戳whisper.cpp 的实验功能。另外small.en-tdrz 这个特殊模型内置实验性的说话人分离会生成两条标签轨道每次说话人切换就换一条——录播客、做多嘉宾字幕时能省掉大量手动对齐。噪声抑制三选一怎么挑入口在 效果 → OpenVINO AI Effects → OpenVINO Noise Suppression。模型下拉里有 deepfilternet2、deepfilternet3 和 denseunet 三个选项文档的明确建议是用 DeepFilterNet 系列denseunet 只是 legacy 保留。它直接修改你选中的轨道处理前最好先复制一份原始轨道留底方便对比。生成与超分最考验参数的两个功能音乐生成生成 → OpenVINO Music Generation是玩具感最强的功能也是最容易玩出惊喜的。几个关键旋钮Seed留空则每次随机结果差异很大想复现某次满意的片段就把当时的 seed 记下来——生成片段本身会在轨道名里标注全部参数复现条件一应俱全。Guidance Scale数值越高越贴 prompt但可能伤音质官方建议 2–4。TopK50 左右出更连贯、结构化的作品拉到 250 以上更天马行空。Context Length Audio Continuation勾选后可以用已有片段续写生成器拿末尾若干秒当上下文。比如先产出 5 秒你满意的开头再勾选延续一路延成长曲。内存管理有个细节模型第一次 Generate 后常驻内存方便反复试参数试够了点 Unload Models 主动释放。实验阶段建议把 Duration 设成 5 秒省时省力。如果生成到一半 fade out 或突然走偏——这是常态——删掉走偏的部分用 Audio Continuation 从好听的尾巴接着续比重新生成整段划算得多。超分辨率效果 → OpenVINO Super Resolution面向修复场景把低质量音频提升到 24kHz 带宽、48kHz 采样率。模型选 Basic (General) 处理音乐和环境声选 Speech 处理纯人声Chunk Size 选 5.12 秒比 10.24 秒可能更好但更慢Steps 越大质量越高、收益递减勾选 Normalize Output RMS 后输出会按输入响度归一音量观感不跳变。值得记住的五个数字与三个坑首次加载 10~30 秒模型在针对设备即时编译之后走磁盘缓存不必每次等。模型整体体积以 GB 计构建文档直接警告按量计费网络下要小心下载前心里有数。模型存放位置Linux 源码构建版在 /usr/local/lib/openvino-modelsWindows 构建版在 Audacity.exe 同级目录snap 版用 audacity.fetch-models 统一管理。Shifts 每 1音乐分离耗时线性翻倍1 预览、2 日常、3–4 出成品。MusicGen 输出 32kHz、超分输出 48kHz混进工程时注意采样率匹配。坑一处理前先复制原轨尤其降噪这类原地修改的效果。坑二未选中音频时打开音乐生成Audio Continuation 会自动置灰这是设计如此不是 bug。坑三模型文件很大换机器重装时直接把 openvino-models 目录拷到新环境能省下整轮重新下载的时间。下一步从一首 2-Stem 开始如果你刚装完最划算的第一步是导入一首歌框选一段效果 → 音乐分离选 2-Stem设备选 GPU没有就 CPUShifts 用 1Apply。几十秒后你就有了人声和伴奏两轨。然后再去 分析 → Whisper Transcription 试一条语音感受标签轨道带时间戳到底长什么样。这两个功能跑通其余三个功能里的参数再多也不慌。继续深挖的入口都在仓库里功能文档在 doc/feature_doc/构建指南在 doc/build_doc/五个功能的 C 实现集中在 mod-openvino/。遇到参数看不懂先翻对应功能的 README 再动手调——这个项目的文档写得很细值得当手册用。【免费下载链接】openvino-plugins-ai-audacityA set of AI-enabled effects, generators, and analyzers for Audacity®.项目地址: https://gitcode.com/gh_mirrors/op/openvino-plugins-ai-audacity创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考