whisper.cpp 模型选型:1 张真实内存表 + 4 条最小命令选对模型 whisper.cpp 模型选型1 张真实内存表 4 条最小命令选对模型【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp克隆仓库构建后whisper.cpp 就能在 CPU 上把本地 16-bit WAV 一次转成文字——这是 OpenAI Whisper 语音识别的 C/C 移植。问题是模型从 75 MiB 到 2.9 GiB 跨度 40 倍选错了要么内存撑爆要么实时性直接掉线。本文只用 3 组可验证的数据磁盘/内存规格、仓库自带 bench 的样例输出、量化前后对比外加 4 个场景映射和最小可运行命令帮你把选型一次做对。git clone https://gitcode.com/GitHub_Trending/wh/whisper.cpp cd whisper.cpp选型前先过的 3 个变量选模型别先翻越大越好的排行先回答三个问题。机器能腾出多少内存运行时内存比磁盘文件大得多且各模型放大倍数不同tiny 磁盘 75 MiB、内存约 273 MBlarge 磁盘 2.9 GiB、内存约 3.9 GB。实时还是批处理麦克风交互要求 1 秒音频在 1 秒内出结果批处理可以慢慢跑。英语还是多语言带.en的变体只识别英语不带.en的多语言。维度对选型的影响可用内存定模型上限约 388 MB 够 base约 852 MB 够 small约 2.1 GB 够 medium约 3.9 GB 才敢上 large延迟要求实时不低于 1x 实时只考虑 tiny/base离线不限输入语言纯英语选.en中英混杂或多语言必须选多语言版磁盘预算大模型可换-q5_0量化版从 2.9 GiB 压到 1.1 GiB数据来源README.md 的内存表与 models/README.md 的模型清单。动手前先看目标机器空闲内存再对号入座。磁盘、内存与 4 线程速度基准模型磁盘运行时内存说明tiny / tiny.en75 MiB~273 MB占用最小多语言/英语双版本base / base.en142 MiB~388 MB均衡选型的基线small / small.en466 MiB~852 MB仓库 bench 样例所用模型medium / medium.en1.5 GiB~2.1 GB多语言高精度基线large-v32.9 GiB~3.9 GB精度最高资源最重large-v3-turbo1.5 GiB—与 medium 同磁盘量级为速度剪枝的架构large-v3-turbo-q5_0547 MiB—量化版比非量化版小 63%磁盘与内存列来自 README.md 内存表和 models/README.md 清单。仓库里唯一硬速度数据是 examples/bench/ README 的样例输出4 线程下small.en的 encode 耗时 1062.21 ms88.52 ms/层总耗时 1303.04 ms环境为 ARMNEON1 BLAS。速度最终取决于你的硬件想要本机数字就自己跑一遍./build/bin/whisper-bench -m ./models/ggml-small.en.bin -t 4数据解读两个反直觉的点最大的模型不一定最划算。large-v3 要 2.9 GiB 磁盘、约 3.9 GB 内存而 large-v3-turbo-q5_0 只有 547 MiB磁盘差 5.3 倍。turbo 架构本身就是为推理速度剪枝出来的再量化后连 medium 的三分之一都不到。硬件塞不下 3.9 GB就直接跳过 large-v3 选 turbo 系。.en变体不省磁盘。tiny 与 tiny.en 同为 75 MiBbase 与 base.en 同为 142 MiB。选.en是放弃多语言换英语专精一个字节都不省。动作在自己机器上跑一次whisper-bench记下 encode 耗时——这个数字才是你实时上限的依据。场景对号4 个典型场景与最小命令以下命令默认已完成构建cmake -B build cmake --build build --config Release并下好模型sh ./models/download-ggml-model.sh base.en。场景是实时麦克风交互 → 选 base.en因为 142 MiB 磁盘、约 388 MB 内存examples/stream/ 工具每 500 ms 采样并持续转写输入输出延迟最低./build/bin/stream -m ./models/ggml-base.en.bin -t 8 --step 500 --length 5000场景是多语言会议/演讲转写 → 选 large-v3-turbo因为 large 级精度但占用只等于 medium且可直接输出 SRT 字幕./build/bin/whisper-cli -m models/ggml-large-v3-turbo.bin -f meeting.wav -l zh -osrt -of meeting.srt场景是低资源设备手机/嵌入式内存 1 GB→ 选 tiny.en因为它是内存表里唯一低于 1 GB 运行时内存约 273 MB的模型./build/bin/whisper-cli -m models/ggml-tiny.en.bin -f samples/jfk.wav场景是资源受限服务器的多语言批处理 → 选 large-v3-turbo-q5_0因为 547 MiB 只有 large-v32.9 GiB的三分之一sh ./models/download-ggml-model.sh large-v3-turbo-q5_0跑起来之后的 3 个调优点1. 输入先转格式。whisper-cli 只接受 16-bit WAV直接喂 mp3 会失败先用 ffmpeg 转ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le output.wav2. 线程数-t按物理核心数定。bench 样例里 small.en 4 线程 encode 1062 ms加线程会压缩这段耗时。先用 examples/bench/ 对比 2/4/8 线程取最优值后再固定到生产命令里。3. 量化是内存收益最大的一档。大模型-q5_0后从 2.9 GiB 压到 1.1 GiBturbo 从 1.5 GiB 压到 547 MiB./build/bin/quantize models/ggml-large-v3-turbo.bin models/ggml-large-v3-turbo-q5_0.bin q5_0一页纸总结场景推荐理由实时麦克风base.en142 MiB、约 388 MB 内存500 ms 级流式多语言高精度large-v3-turbo(-q5_0)1.5 GiB→547 MiBlarge 级精度、剪枝提速低资源设备tiny.en75 MiB、约 273 MB唯一 1 GB 选项英语批处理base.en / small.en磁盘与精度均衡16-bit WAV 即插即用完整构建流程与全部模型README.md速度基准工具examples/bench/实时输入示例examples/stream/量化脚本examples/quantize/。【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考