本地音频转录工具Buzz完全指南:如何用Whisper在个人电脑上免费离线完成语音转文字 本地音频转录工具Buzz完全指南如何用Whisper在个人电脑上免费离线完成语音转文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz把一段40分钟的会议录音变成可检索的文字过去你要么付费订阅云转录服务要么雇人逐句打字。而 Buzz 这款基于 OpenAI Whisper 的开源音频转录工具让这件事变成了一次点击——它运行在你自己电脑上全程离线、不传文件、不花一分钱。本文不打算罗列功能清单而是带你从我有个音频要转文字的真实需求出发用一条完整链路跑通本地语音转文字。你有没有被一小时录音一个下午整理折磨过先还原一个具体场景周二开完周会你拿到一份90分钟的录音。领导要会议纪要同事要行动项客户要确认记录。你的选择通常是自己听一遍边听边打字一个半小时的音频耗掉整个下午用在线转录网站先把文件传上去等它排队、转码、返回结果还要担心隐私让实习生逐句听写准确率靠不住返工成本更高。这还没算外语材料一段德语访谈、一场英文发布会听懂已是门槛何况还要落成文字。问题从来不是缺工具而是缺一个不用上传、足够准确、本地离线的解决方案。这正是本文要帮你搭起来的东西。先建立坐标系Buzz 到底替代了什么在动手之前值得花30秒想清楚你正在替换的旧流程这决定了后面每一步配置的价值。旧方案一在线云转录服务。优点是零安装缺点是隐私风险与网络依赖。文件要上传到对方服务器录制内容一旦涉密就很麻烦免费额度有限大文件往往要付费。Buzz 把所有计算放在本地音频始终不出你的硬盘。旧方案二手动打字 / 外包听写。成本高、周期长、不可复用。Buzz 一次转录的产出是带时间戳的结构化文本可以反复导出为不同格式还能编辑、翻译、按说话人拆分。旧方案三裸用 Whisper 命令行。如果你接触过 OpenAI 的 Whisper会知道它本身只有命令行与 Python 接口需要自己折腾环境、处理模型下载、写输出脚本。Buzz 相当于给 Whisper 套了一层完整的产品外壳图形界面、任务队列、实时录音、导出管理底层仍由 Whisper 家族驱动。换句话说Buzz 补上的是Whisper 引擎到普通用户之间的那段距离。它把专业能力封装成一个个可点按的操作同时保留了 CLI 与插件接口让你随时可以钻到引擎盖下面。挑战目标10分钟拿到第一份可用的转录文本不要被配置模型GPU加速这些词吓退。我们的第一个目标非常具体10分钟内把一段几分钟的音频变成一份 TXT 文件。全程只做四步。第一步选一种安装方式要做什么 → 为什么 → 踩坑Buzz 支持 Windows、macOS、Linux也支持 Python 环境直接安装。三选一即可你的系统推荐方式一句话说明Windows / macOS从项目发布页下载.dmg或安装程序开箱即用含完整运行环境Linux桌面Flatpak 或 Snap与系统包管理集成自动更新会 Pythonpip install buzz-captions轻量、可控适合开发者Linux 下两条命令搞定# Flatpak 方式一条命令装完沙箱隔离、自动升级 flatpak install flathub io.github.chidiwilliams.Buzz # Snap 方式先装音频依赖再装应用 sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzzPython 方式稍微多一步需要先有 Python 3.12 环境和 ffmpegpip install buzz-captions # 安装 Buzz 本体 python -m buzz # 启动图形界面踩坑提示Windows 安装包未签名首次运行会弹系统警告选择更多信息 → 仍要运行即可Linux 用 Flatpak 装好后如果界面不跟随系统主题通常需要把主题文件复制到~/.themes并给 Flatpak 授权访问常见问题的完整解法在仓库docs/docs/faq.md里有。这里最容易卡住的是装好了打不开九成原因是缺音频库装上前面的libportaudio2基本能解决。第二步导入一个文件要做什么 → 为什么 → 踩坑启动后你会看到主界面——一个任务队列式的表格窗口。点工具栏的 图标或直接按Ctrl/Cmd O选择任意音频或视频文件。Buzz 对输入格式非常宽容MP3、WAV、M4A 等音频文件MP4、AVI、MKV 等视频文件甚至YouTube 链接都可以直接粘贴进来它会自动拉取音轨。为什么能这么省事Buzz 内部用 ffmpeg 处理一切音视频解封装你不需要预先把视频转成音频它替你做了。这步是最容易低估的便利——省掉的不只是一个转换步骤而是整条格式转换 → 手动管理中间文件的支线流程。踩坑提示导入 YouTube 链接时如果遇到无法解析的报错多半是网站反爬机制需要在首选项中配置 cookie 文件环境变量BUZZ_DOWNLOAD_COOKIEFILE指向你导出的 cookie 文件即可。第三步配置四个参数要做什么 → 为什么 → 踩坑导入后弹出的表单里有四个关键设置其他都可以用默认值任务类型Task选转录保留原语言选翻译会输出英文。默认是转录。语言Language强烈建议手动指定不要依赖自动检测。自动检测偶尔会把短音频的语言判断错一旦判错后续全部白跑。模型类型Model Type新手直接保持默认的 Whisper 即可后面进阶武器库再细讲。模型大小Model Size默认 Tiny追求更高质量就选 base 或 small。为什么语言这步值得强调Whisper 对已知语言和猜测语言的准确率差距很大手动指定等于把你掌握的先验信息白送给模型。这是投入产出比最高的一处设置。踩坑提示首次运行会自动下载模型文件Tiny 约几十 MB需要联网下载完成后就完全离线了。如果网络慢可以把HF_ENDPOINThttps://hf-mirror.com写入启动脚本加速镜像。第四步点击 Run等状态变成 Completed点击运行后任务行会显示实时进度百分比。对一段几分钟的音频Tiny 模型在普通电脑上通常以分钟计。完成后双击该行即可打开转录结果查看器看到带时间戳的逐句文字。到这里你已经用 10 分钟完成了安装 → 导入 → 转录 → 查看的完整闭环。恭喜本地离线转录能力正式入手。一场真实操练把一场法语会议变成双语纪要第一个结果到手后我们把它升级成一条真实工作流。假设你要处理一场法语内部评审会的录音最终要交付法语逐字稿 英文翻译 可对外分享的 SRT 字幕。整个过程用 Buzz 串起来是这样的。第1站导入 手动指定语言按下 Ctrl/Cmd O 选择录音文件任务类型选转录语言明确填fr法语模型选 small 或 medium会议内容密集Tiny 的错字率会让你返工。为什么是 small 起步它比 base 准不少又在 CPU 上跑得动属于性价比拐点。第2站用初始提示喂术语点击高级按钮在Initial Prompt初始提示里填入会议中会反复出现的人名、产品名、专业缩写例如评审委员会Alpha 模块回归测试Q3 里程碑Marie LaurentChen Wei原理很简单Whisper 的提示词会显著压低这些词的拼写错误率。这一项是提升准确率最便宜的手段——不消耗算力只消耗你打字的一分钟。凡是人名、地名、品牌名密集的内容强烈建议每次都填。第3站勾选单词级时间戳同一面板里打开Word-Level Timings。它会为每个词生成独立时间戳虽然文件变大但换来的是后面可编程的灵活性可以精确跳转到某个词、可以按任意长度重组字幕。转录完成后双击打开查看器。第4站用查看器里的翻译做二次翻译默认转录任务只产出法语。要英文版本点击查看器工具栏的Translate按钮Buzz 会调用 OpenAI 兼容接口在首选项里配置 API Key 与 Base URL把已识别文本翻译成目标语言。这意味着翻译不用重新跑模型识别一次、翻译多次语言之间随意切换。成本参考一小时音频的 AI 翻译大约 1 美元级别取决于所用模型。如果不想花钱也可以直接在下一次任务里选翻译任务让 Whisper 原生转英文——两条路各有利弊前者语言自由后者零成本。第5站导出三种格式查看器的导出菜单里一次任务可以同时输出TXT纯文本丢给任何人都不挑软件SRT标准字幕直接拖进剪映、Premiere 或播客工具JSON结构化数据带时间戳方便写脚本做后续分析。到这一步一份法语逐字稿、一份英文纪要、一份带时间轴的 SRT 全部就位全程没有离开这台电脑。进阶武器库四个瓶颈四件武器上手之后你会遇到的实际瓶颈无非四类太慢、不准、重复劳动、格式不对。逐个击破。瓶颈一转录太慢给模型选对发动机Buzz 支持的模型后端不止一个它们的定位差异很大后端特点适合谁WhisperOpenAI 原版最稳但偏慢无 GPU、追求兼容性Faster Whisper优化重写速度提升一个数量级内存占用低有 NVIDIA GPU≥6GB 显存Whisper.cppC 实现几乎任何 GPU 都能用集成显卡也能跑实时无 NVIDIA 卡、Mac 用户HuggingFace可加载社区自定义模型含 MMS 千语种、Parakeet 等需要特定语言/领域模型如果你的电脑有 NVIDIA 显卡装好 CUDA 版 PyTorch 后选 Faster Whisper是提升最明显的一步。Python 安装用户可这样配置 GPU 支持# 安装带 CUDA 12.9 的 PyTorch 与配套库让转录跑在显卡上 pip3 install -U torch2.8.0cu129 torchaudio2.8.0cu129 --index-url https://download.pytorch.org/whl/cu129 pip3 install nvidia-cublas-cu1212.9.1.4 nvidia-cuda-cupti-cu1212.9.79 nvidia-cuda-runtime-cu1212.9.79 --extra-index-url https://pypi.ngc.nvidia.com没有 NVIDIA 卡也别灰心Whisper.cpp 支持 Vulkan 加速集成显卡一样能用M 系列 Mac 更是原生优化。老机器上还可以用环境变量BUZZ_FORCE_CPUtrue强制 CPU 模式避免显卡驱动问题导致的异常。模型管理在首选项 → Models页已下载模型、可下载模型、自定义模型链接都在这里还能一键打开模型文件所在目录。如何选模型大小Tiny/Base 用于实时与短音频Small/Medium 用于会议与播客Large 系含 V2/V3/Turbo用于学术级精度。原则永远是在你的硬件上能跑动的前提下尽量大。瓶颈二错字太多三个手段叠加手动指定语言前面讲过优先级最高初始提示喂术语人名地名专有名词直接解决提取语音Extract Speech针对嘈杂录音开启后 Buzz 会先用分离模型把语音从背景音里抽出来再转录。施工现场、咖啡馆、多人说话的录音准确率提升非常明显代价是额外耗时。瓶颈三大量文件要反复处理让机器自己动三种自动化手段按需求选文件夹监控首选项 → Folder Watch 里指定一个目录之后任何新放进来的音频都会被自动转录。适合每周固定丢一批录音进来的固定流程。跳过已转录文件配合内置插件重扫文件夹时自动识别已有结果的音频并跳过避免重复烧算力。它通过检查同名结果文件或查询转录数据库两种方式判断默认开启前一种。命令行批处理脚本化是终极形态。buzz add支持完整的参数体系例如# 把一批 mp3 全部转成中文转录 SRT 字幕统一输出到 ./transcripts buzz add --task transcribe --language zh --model-type whisper --model-size medium \ --srt --output-directory ./transcripts audio_files/*.mp3 # 不想弹窗口后台静默跑适合挂服务器或定时任务 buzz add --task transcribe --hide-gui --model-type whispercpp --model-size small *.wav完整参数--task、--model-type、--model-size、--language、--prompt、--word-timestamps、--extract-speech、--srt/--vtt/--txt、--output-directory、--hide-gui都维护在仓库的docs/docs/cli.md里。把buzz add写进 cron 或 shell 脚本你的转录流水线就全自动了。瓶颈四字幕不齐、断行难看用 Resize 一键整理转录结果默认按模型切分断句位置经常不适合当字幕。内置的调整转录功能Resize专门解决这个设定期望字幕长度默认42字符、按静默间隙合并、按标点分割、按最大长度强制换行。快速对话缩短每行字数提升可读性演讲内容加长减少换行配合间隙合并和标点分割基本能一次到位。高频疑问快问快答Q1模型文件存在哪我想备份或拷到无网机器上用。Linux 在~/.cache/BuzzmacOS 在~/Library/Caches/BuzzWindows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。去首选项 → Models 点显示文件位置可直接打开。把整个 models 目录拷到另一台离线电脑的相同位置就能完全断网使用仓库的scripts/download-models.py也可以帮你批量准备离线模型缓存。Q2为什么我选了大模型反而更慢甚至崩了大模型Medium/Large对内存要求高内存不足会触发交换导致速度暴跌。建议先看内存是否 ≥8GBLarge 建议 ≥16GB再考虑开BUZZ_REDUCE_GPU_MEMORYtrue启用 8bit 量化压缩显存占用。模型下载中断也会导致崩溃去 Models 页删掉重下一次即可。Q3能转录电脑的系统声音吗比如在线会议的语音可以需要一块虚拟声卡。macOS 用 BlackHoleWindows 用 VB-CABLELinux 用 PulseAudio 相关工具把目标应用的声音输出路由到虚拟设备然后在 Buzz 的实时录音里把输入源选成它。这样连 Zoom/腾讯会议的声音都能实时转文字。Q4实时录音有延迟怎么办在实时录音设置里把延迟调到 20-30 秒区间——这是给模型积累足够上下文的时间调太低反而因频繁分段而更卡。另外优先用 Tiny/Base 模型跑实时别让 Medium 以上的模型干活。如果是给观众看的场合用演示窗口全屏投影即可还支持调节字体大小和颜色。Q5Buzz 需要常联网吗只有两件事需要网络首次下载模型和可选的 AI 翻译/摘要功能。模型就位后转录本身完全离线。Q6我想让转录结果自动存成更好看的文件名在首选项里修改默认导出文件名模板支持变量{{input_file_name}}、{{task}}、{{language}}、{{model_size}}、{{date_time}}等。例如设为{{input_file_name}} ({{task}}d on {{date_time}})导出文件会自动变成会议 (transcribed on 19-Sep-2025 14-30-05).txt。Q7插件有什么用怎么装插件系统在帮助 → 插件菜单管理。内置插件里AI 摘要把转录一键总结成要点并写入备注导出 DOCX直接生成 Word 文档增强语言检测在转录前先用本地模型自动识别语言DeepFilterNet 降噪在转录前滤掉背景噪音跳过已转录避免重复算力。想给某个环节加自定义逻辑可以照抄buzz/plugins/下的内置插件源码写自己的也可以通过按 URL 添加安装社区打包好的.zip插件。下一步行动清单与学习路径到这里你已经有能力把 Buzz 当作日常生产力工具了。建议按这个顺序往下走先跑通最小流程导入一段 3 分钟音频Tiny 模型出 TXT感受全流程配置语言与提示词处理一段真实会议录音手动指定语言 填初始提示升级引擎有 GPU 就切 Faster Whisper没有就试 Whisper.cpp建立自动化把常用批量命令写成脚本或配置文件夹监控按需扩展需要摘要装 AI 摘要插件需要 Word 装导出 DOCX需要实时字幕研究演示窗口。想深入研究的入口都在这份代码里命令行参数与完整示例见docs/docs/cli.md常见问题离线部署、GPU 配置、崩溃排查见docs/docs/faq.md功能操作说明在docs/docs/usage/下的分篇文档插件开发规范在buzz/plugins/AGENTS.md转录引擎与界面代码分别位于buzz/transcriber/与buzz/widgets/。如果你是开发者还可以通过git clone https://gitcode.com/GitHub_Trending/buz/buzz拉取源码做二次开发。最后给你一句实操忠告工具的上限由模型决定工具的下限由你的设置决定。手动指定语言、喂好初始提示、选对模型后端这三件事就能覆盖大多数场景下 80% 的质量提升。现在去找一段拖延已久的录音把它变成文字吧。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考