来源:互联网 更新时间:2026-08-25 19:31
视频音效生成技术正迎来关键突破。小米大模型应用团队近日开源了名为ControlFoley的统一可控视频音效生成模型,旨在解决视频配音中的“可控性”难题。该模型不仅支持根据画面自动生成音效,更首次统一实现了文本引导、文本控制及参考音频控制三类核心任务,让创能够真正按意图为视频定制声音。

传统的视频音效生成模型主要依赖画面内容,虽然能让无声视频“有声音”,但创难以干预生成结果。ControlFoley的核心目标是将视频音效生成从“看画面配声音”推进到“按意图配声音”的新阶段。该模型在多个公开评测基准上取得了开源模型中的最佳表现,并在语义对齐、时间同步及声音质量等关键指标上实现全面提升。
ControlFoley构建了一个统一的多模态音频生成框架,具备三类核心能力。首先是文本引导视频配音,模型根据视频和文本提示生成同步音效,文本用于补充和细化画面中的声音语义。其次是文本控制视频配音,当文本描述与视频画面语义发生冲突时,模型能
为实现精准控制,团队提出了多项创新技术。针对视觉信息在多模态融合中过于强势的问题,团队自训练了时空音视频编码器CA V-MAE-ST。该编码器通过视频帧与音频特征的联合建模,专门捕捉“动作何时发生、声音应何时出现”这类音视频时空对应关系,增强了模型对动作节奏和时间同步的理解。
在参考音频控制方面,模型采用了
为适应真实应用中用户输入条件不固定的情况,ControlFoley采用了随机模态丢弃和统一多模态表示对齐训练,确保模型在不同条件组合下都能稳定工作。评测结果显示,在VGGSound-Test、Kling-Audio-Eval等多个基准测试中,ControlFoley均取得了开源SOTA表现。
与部分方法相比,ControlFoley在乐器演奏、体育运动等场景中生成的声音,能在动作发生的关键时刻精准对齐视频节奏,并保留更完整的高频细节。对比商业闭源系统Kling-Foley,ControlFoley在语义对齐、时间同步和声音质量等关键体验指标上也展现出竞争力。目前,该模型的代码、模型权重、技术报告及在线演示均已向社区开放。
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
比特币 2025 年价格预测:BTC 的未来走势
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
5000元起的鼠标哪个最值得入手?
男生高性价比充电头?
腾讯ima知识库怎么分类管理?
博世壁挂炉关闭暖气怎么操作
车载冰箱重置到出厂设置几步?
Windy卫星云图怎么看?云层变化识别技巧
5000-6000元鼠标有什么推荐?
管线机怎么接云米净水器
笔记本移动电源推荐哪款?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc