来源:互联网 更新时间:2026-08-07 14:36
腾讯音乐娱乐实验室最近开源了一个名为 MuseTalk 的模型,它主打实时、高品质的唇形同步。简单来说,它能根据输入音频,让视频中的人物口型精准匹配语音,并且可以和 MuseV 生成的视频无缝衔接,形成完整的虚拟数字人解决方案。
那么,这个模型到底有哪些硬核能力?
MuseV 和 MuseTalk 搭配使用,就是一套完整的虚拟人生成流程:先用 MuseV 生成视频(文本到视频、图像到视频或姿态到视频),建议用帧插值提高帧率,然后再用 MuseTalk 做音唇同步。
MuseTalk 的训练方式很有意思。它是在潜在空间中进行的,图像由冻结的 VAE 编码,音频由冻结的 whisper-tiny 模型编码。生成网络借鉴了 stable-diffusion-v1-4 的 UNet 架构,音频嵌入通过交叉注意力与图像嵌入融合。
注意:虽然架构和 Stable Diffusion 很像,但 MuseTalk 并不是扩散模型。它的独特之处在于,通过单步修复在潜在空间中完成操作,而非多步去噪。

<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3458017262458568705"></iframe>
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3458017618454315010"></iframe>
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3458017845651374081"></iframe>
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3458018203006074882"></iframe>
对于视频配音,官方团队应用了一个自行开发的工具识别说话的人物完成配音。下面展示的视频原地址为:https://www.bilibili.com/video/BV1wT411b7HU
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3458018578496946177"></iframe>
目前社区已经有对应的 ComfyUI 插件支持,插件地址为:https://github.com/chaojie/ComfyUI-MuseTalk。搭建流程稍微有点复杂,需要折腾一阵。如果想快速体验,建议直接参考下面的一键安装包(网上有热心大佬整理)。不过这里我们重点介绍标准的手动安装步骤:
ComfyUI 插件安装步骤如下:
ComfyUI/models/diffusers/TMElyralab/MuseTalk/
├── musetalk
│ └── musetalk.json
│ └── pytorch_model.bin
├── dwpose
│ └── dw-ll_ucoco_384.pth
├── face-parse-bisent
│ ├── 79999_iter.pth
│ └── resnet18-5c106cde.pth
├── sd-vae-ft-mse
│ ├── config.json
│ └── diffusion_pytorch_model.bin
└── whisper
└── tiny.pt
另外,官方说默认会自动下载 s3fd.pth 文件,但实际测试下来似乎并不会。如果遇到以下报错,就需要手动将 s3fd.pth 文件放置在 /ComfyUI/custom_nodes/ComfyUI-MuseTalk/musetalk/utils/face_detection/detection/sfd 目录下。
RuntimeError: unexpected EOF, expected 15021382 more bytes. The file might be corrupted.
Cannot import MuseTalk module for custom nodes: unexpected EOF, expected 15021382 more bytes. The file might be corrupted.
除了模型下载外,还需要手动安装如下依赖:
pip install --no-cache-dir -U openmim
mim install mmengine
mim install "mmcv>=2.0.1"
mim install "mmdet>=3.1.0"
mim install "mmpose>=1.1.0"
最后,导入对应的工作流文件(可以从项目的 GitHub 页面或社区分享中获得),重启 ComfyUI 即可。
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3463149723110801408"></iframe>
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3463225545205153796"></iframe>
由于微信文章视频数量限制,以下案例就仅放置输出视频效果展示。
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3463149294889140226"></iframe>
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3463146202881785857"></iframe>
Ondo将于今日上线股票永续合约
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
区块链OTC交易所有哪几家比较正规?
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
合集38个项目筹集5.406亿美元 Figure融资2亿
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
五菱星光L六座新能源SUV上市:三版可选,中配12.28
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
macOS 28将移除Rosetta 2兼容层,Intel应用面临运行危机
腾讯ima怎么创建共享知识库?
全球首款AI智能体手机即将首秀!网友猜测或为豆包手机2代
小鸡答题今天的答案是什么2026年7月9日
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc