
如何三分钟克隆你的声音OpenVoice本地部署完整指南【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoiceOpenVoice 是 MIT 与 MyShell 开源的即时语音克隆方案MIT 协议可免费商用只需一段几秒的参考音频就能复制那个人的音色让 TA 说任意文字。V2 版本原生支持英、西、法、中、日、韩六种语言还允许参考语音与目标语言完全不同。一分钟人声样本这个项目和谁有关给短视频配音但不想用真声想给角色或数字人一个音色稳定的 AI 声线想把外文台词换成自己的中文声音这些场景的共同点是不想做繁琐的模型微调但需要像某个人的声音。OpenVoice 把这件事压缩到一步——录一段 5~15 秒、无背景噪音的参考音频上传即可开始克隆不需要为每个说话人单独训练。 如何快速安装OpenVoice并跑通第一次语音克隆官方建议 Linux Python 3.9 环境安装分两步conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .V1 和 V2 的安装命令完全相同区别只在模型文件从 docs/USAGE.md 中的链接下载检查点V1 为 checkpoints_1226.zipV2 为 checkpoints_v2_0417.zip分别解压到checkpoints或checkpoints_v2文件夹。若要用 V2 的六语言能力还需额外安装 MeloTTS 多语言 TTS 库并运行python -m unidic download。装好后走最快的路——启动内置的 Gradio 本地 Web 界面python -m openvoice_app --share打开页面后输入文本单次 200 字以内→ 选择风格default、whispering、sad、cheerful 等→ 上传参考音频 → 点 Send克隆结果会自动保存到outputs文件夹。本地演示主要支持英文和中文。为什么它能行音色和说话风格被拆成了两个模块OpenVoice 的架构把语音生成分成两件互不干扰的事基础说话人 TTS 模型负责说什么、什么语言、什么情绪输出内容语音音色转换器Tone Color Converter负责用谁的声音说把参考音频提取出的音色嵌入贴到内容语音上。所以情绪、口音由基础模型决定像谁由参考音频决定。两者解耦是它能一边换语言一边保住音色的根本原因。多语言场景下它再用 IPA国际音标给每个发音定标准记号做音素级对齐保证跨语言转换时发音位置不出错。进阶玩法三种可以直接试的用法风格控制调用时改speaker参数即可在 whispering、shouting、cheerful、sad、angry 等 8 种风格间切换speed参数控制语速换风格后需加载对应的音色嵌入文件如en_style_se.pth。零样本跨语言克隆参考语音和输出语言不需要相同。英文参考音可以直接说西班牙语、德语基础说话人甚至可以换成 OpenAI TTS 等任意现成 TTS官方给了完整示例 demo_part2.ipynb。V2 六语言原生输出V2 检查点搭配 MeloTTS同一份参考音色可连续朗读美音、西语、法语、中文、日语、韩语音质比 V1 更稳见 demo_part3.ipynb。音色不还原怎么排查一张表看懂常见问题症状原因与解法输出音色、口音、情绪和参考不一致OpenVoice 只克隆音色不克隆口音与情绪——后者由基础模型决定想换口音需换基础模型音频有杂音、失真检查参考音频是否干净、单人、无长静音同文件名重新提取前删除processed缓存文件夹启动时报 Silero 下载错误VAD语音活动检测模型需联网下载受限网络下手动下载 silero-vad 包放入 torch hub 缓存目录效果不稳定、翻车率高官方定位是技术而非成品参考音频过短或质量差都会拉低效果属预期行为更多细节见 docs/QA.md。它适合谁下一步该做什么OpenVoice 面向需要把语音克隆能力集成进产品或研究的开发者不是开箱即用的消费级工具某语言若缺基础说话人模型需要自行训练或接入现成 TTS。建议先跑通 Gradio 界面建立体感再按 demo_part1.ipynb、demo_part2.ipynb、demo_part3.ipynb 的顺序复现风格→跨语言→V2 多语言三条链路即可完整掌握它的音色、风格与语言控制方式。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考