行业资讯
📅 2026/9/1 14:13:50
如何快速上手 OpenVoice 语音克隆:从零到跑通的完整实战教程
如何快速上手 OpenVoice 语音克隆从零到跑通的完整实战教程【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice一、它是什么为什么要读这篇 OpenVoice 是一个开源的即时语音克隆工具给一段 5~15 秒的参考音频它就能用这个人的音色朗读你写的任何文本原生支持中、英、日、韩等 6 种语言MIT 协议可免费商用。下面用 15 分钟带你从零跑通最小示例再顺手解决跨语言克隆和常见报错。二、亮点速览 5 秒音色克隆参考音频无需训练提取一个音色向量tone color embedding直接套用。收益不用为每个人建模型一段语音就能变成任何人。零样本跨语言克隆参考音频说英文也能输出中、日、韩语音音色保持不变。收益一套流程做多语言配音。音色与内容解耦先用基础 TTS 生成任意语言语音再换音色语速、语言、情感可分别控制。收益风格怎么调都不破坏音色还原。MIT 开源 自带 Web 界面免费商用还能一行命令起 Gradio 页面直接试。三、快速上手 ⚡环境要求Linux 环境官方文档按 Linux 编写Windows/Docker 有社区指南Python 3.9、conda、PyTorch有 GPU 体验更好约 1GB 显存即可跑推理CPU 也能跑但较慢第一步克隆并安装conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .第二步准备模型按 docs/USAGE.md 中的链接下载 OpenVoice V2 模型包解压到项目的checkpoints_v2目录再按同一文档安装 MeloTTSV2 的基础 TTS 模型并执行python -m unidic download下载日语词典。第三步最小可运行示例参考音频可直接用仓库自带的resources/example_reference.mp3或换成你自己的干净人声from openvoice.api import ToneColorConverter from openvoice import se_extractor from melo.api import TTS import torch device cuda if torch.cuda.is_available() else cpu converter ToneColorConverter(checkpoints_v2/converter/config.json, devicedevice) converter.load_ckpt(checkpoints_v2/converter/checkpoint.pth) target_se, _ se_extractor.get_se(resources/example_reference.mp3, converter, vadTrue) melo TTS(languageEN, devicedevice) melo.tts_to_file(Hello, this is OpenVoice speaking., 0, tmp.wav, speed1.0) src_se torch.load(checkpoints_v2/base_speakers/ses/en_default.pth, map_locationdevice) converter.convert(tmp.wav, src_se, target_se, output_pathcloned.wav, messageOpenVoice)跑完打开cloned.wav内容是那两句英文音色却是参考音频里的人。这就是 OpenVoice 语音克隆的完整闭环。四、功能实战4.1 基础语音克隆让任何人读任意文本 使用场景做播客配音、有声书想用自己或授权者的声音朗读脚本。操作步骤准备 5~15 秒、无背景噪声的参考音频se_extractor.get_se()提取目标音色向量target_se自动做 VAD 切掉静音段MeloTTS 生成基础语音后用convert()换成目标音色。converter.convert(tmp.wav, src_se, target_se, output_pathcloned.wav, messageOpenVoice)预期效果输出音色贴近参考音频语速、语言、停顿由基础 TTS 决定默认会写入隐形水印wavmarkmessage参数即水印内容。4.2 跨语言语音克隆英文原声输出中文/日语 使用场景给视频做多语言版本但希望同一个人用各语言说话。核心技巧换 MeloTTS 的语言和对应的src_se文件target_se保持不变。操作步骤复用 4.1 提取的target_se初始化对应语言的 TTS 并生成基础语音加载该语言基础说话人的src_se执行转换。melo TTS(languageZH, devicedevice) melo.tts_to_file(这是一个跨语言克隆示例。, 0, tmp_zh.wav, speed1.0) src_se torch.load(checkpoints_v2/base_speakers/ses/zh-default.pth, map_locationdevice) converter.convert(tmp_zh.wav, src_se, target_se, output_pathcloned_zh.wav)预期效果一句中文用英文参考音频的音色念出来。更多语言ES/FR/JP/KR的写法见 demo_part3.ipynb。4.3 Gradio Web 界面不想写代码怎么办 使用场景快速演示、试听效果不想配 Python 环境。操作步骤按 docs/USAGE.md 下载 V1 模型包解压到checkpoints目录Web 界面基于 V1 检查点支持中、英自动检测启动python -m openvoice_app --share浏览器打开终端里给出的链接输入文本、上传参考音频、点生成即可。预期效果一个极简本地页面支持选择基础说话人直接在线克隆试听。五、调优与避坑 常用参数参数推荐值影响参考音频时长5~15 秒太短音色不稳太长没必要参考音频质量单人、无背景噪声对成片质量影响最大优先保证这一条vadget_seTrue自动切掉参考音频里的静音段减少干扰tauconvert0.3音色转换强度值越大输出越贴近参考音色speedMeloTTS1.0语速调小变慢、调大变快常见问题现象 → 原因 → 修复现象调get_se时报 silero-vad 下载失败。原因机器无法访问其模型源。修复手动下载 silero-vad 包并解压到~/.cache/torch/hub对应目录详见 docs/QA.md。现象输出音质差、有杂音。原因参考音频有背景噪声、太短、含多人说话或长静音。修复换一段 5~15 秒的干净单人录音重新提取。现象参考音频换了内容结果却和之前一样。原因se_extractor把中间结果缓存在processed目录同名文件会命中旧缓存。修复删掉processed目录后重新运行。现象输出的口音、情感和参考人不像。原因OpenVoice 只克隆音色口音和情绪由基础说话人模型决定不属于克隆范围。修复换带目标口音的基础说话人模型示例见 demo_part2.ipynb。六、适合谁以及继续看哪里 适合想把即时语音克隆、零样本跨语言配音集成进自己应用的开发者和研究者。不适合期望开箱即用的完美商用产品——官方定位是技术而非产品稳定性需要你自己打磨。继续深入看这三份资料即可安装与使用说明docs/USAGE.md常见问答docs/QA.mdV2 完整示例含 6 语言demo_part3.ipynb【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考