来源:互联网 更新时间:2026-08-12 17:12
从一小段音频里复制出某个人的声音,然后让它说出多种语言——这听起来像是科幻片里的桥段,但OpenVoice确确实实地做到了。它不仅能把音色克隆得精准,还能对情感的浓淡、口音的轻重、语速的快慢乃至语调的起伏做精细调节。下面这张图可以让你快速感受它的能力:


OpenVoice的第一项看家本领,就是能从参考音频中精确提取说话人的音色特征,然后把这个特征“移植”到任何一个目标语言的发音上。无论是英语、中文还是其他语种,克隆后的声音都保留了原声的辨识度,不会出现“四不像”的尴尬。

更难得的是,你可以在保留音色的前提下,单独控制语音的风格参数——比如让声音听起来更开心或更严肃,带点地方口音或保持标准吐字,甚至可以精细调节停顿的时长和语调的升降。下面的演示展示了情感和口音两个维度的调节效果:

所谓“零样本”,意味着参考语音所用的语言可以完全不在模型的训练集里。即便你给出一段从未见过的语言(比如某种小语种)的原始音频,OpenVoice也能照常克隆,并生成其他语言的语音。下面的例子特意用“U”标记那些训练时未出现过的语言,效果依然让人印象深刻:

如果你是熟悉Linux、Python和PyTorch的开发者,可以按照下面的步骤快速上手。克隆仓库后,执行:
conda create -n openvoice python=3.9
conda activate openvoice
git clone git@github.com:myshell-ai/OpenVoice.git
cd OpenVoice
pip install -e .
无论使用V1还是V2版本,上述安装过程都是一致的。
下载V1检查点并解压到 checkpoints 文件夹(具体下载地址请参考官方文档)。然后可以分别尝试以下三种用法:
demo_part1.ipynb,了解如何在克隆声音的基础上自由调节风格。demo_part2.ipynb,体验训练集内和训练集外语言的效果。python -m openvoice_app --share 启动一个简约的界面。如果遇到问题,建议优先阅读前面两个notebook以及FAQ。V2版本在安装步骤上与V1相同,但需要额外安装MeloTTS:
pip install git+https://github.com/myshell-ai/MeloTTS.git
python -m unidic download
下载V2检查点并解压到 checkpoints_v2 文件夹。演示用法请参考 demo_part3.ipynb。V2原生支持英语、西班牙语、法语、中文、日语和韩语六种语言。
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
区块链OTC交易所有哪几家比较正规?
2026热门直线加速赛车手游推荐:高人气、爽快加速体验的精品榜单
腾讯ima怎么把微信内容一键导入知识库?
kimi提示词专家使用方法新手指南
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
原神霜月三处月灵龛具体位置汇总
《幻兽帕鲁》不触发通缉捕捉传说商人方法
Windy卫星云图怎么看?云层变化识别技巧
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
为什么推特KOL都在BRC20赚钱 我一冲就亏?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
一加手机如何设置三指长按屏幕局部截图
合集38个项目筹集5.406亿美元 Figure融资2亿
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc