热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai教程 >Meta版Sora无预警来袭

Meta版Sora无预警来袭

来源:互联网 更新时间:2026-07-20 07:18

数据规模、模型大小、训练算力——这三个维度的系统提升,才是让如此强大的媒体生成系统成为可能的关键。Meta这篇论文里特别强调了这一点,而最让业界兴奋的是:他们这次彻底扔掉了扩散模型和扩散损失函数,改用Transformer做骨干网络,流匹配(Flow Matching)做训练目标。可以说,这是一次架构层面的果断转向。

用Llama3架构做视频模型

具体来说,Movie Gen由视频生成和音频生成两个模型组成。

Movie Gen Video是一个30B参数的Transformer模型,能从单个文本提示生成16秒、16帧每秒的高清视频,相当于73K个视频tokens。在精确视频编辑方面,它可以执行添加、删除或替换元素,以及背景替换、样式更改等全局修改。对于个性化视频,它在保持角色身份一致性和运动自然性方面达到了SOTA水平。

\

Movie Gen Audio是一个13B参数的Transformer模型,接受视频输入以及可选的文本提示,生成与视频同步的高保真音频。

\

Movie Gen Video通过预训练-微调范式完成,在骨干网络架构上沿用了Transformer,特别是Llama3的许多设计。

\

预训练阶段

海量的视频-文本和图像-文本数据集上进行联合训练,学习对视觉世界的理解。训练数据规模达到了O(100)M视频和O(1)B图像,用以学习运动、场景、物理、几何、音频等概念。这相当于让模型先大量“阅读”视觉世界的各种可能。

微调阶段

研究人员精心挑选了一小部分高质量视频进行有监督微调,以进一步提升生成视频的运动流畅度和美学品质。好比给模型做“精修训练”,让它知道什么是好看的、顺滑的。

\

效果提升的关键一步是引入了流匹配作为训练目标,这让视频生成在精度和细节表现上优于扩散模型。简单理解:扩散模型是通过逐步加噪再逐步去噪来逼近目标,迭代步数多、计算成本高;而流匹配则是直接学习样本从噪声向目标数据分布转化的速度,模型只需估计每个时间步如何演化样本。结果就是:训练更高效,计算成本更低,生成结果在时间维度上拥有更好的连续性和一致性。

\

整体架构上,首先通过时空自编码器(TAE)将像素空间的RGB图像和视频压缩到时空潜空间,学出一个更紧凑的表征。接着,输入的文本提示被一系列预训练的文本编码器编码成向量表示,作为模型的条件信息。这里用到了多种互补的文本编码器:理解语义的UL2、与视觉对齐的Long-prompt MetaCLIP,以及理解视觉文本的字符级编码器ByT5。最后,生成模型以Flow Matching的目标函数训练,从高斯分布采样的噪声向量作为输入,结合文本条件,生成输出潜码,再经过TAE解码得到最终的图像或视频输出。

\

此外,Movie Gen Video在技术上还引入了多项创新:

为了让模型同时适配图像和视频,设计了一套因子化的可学习位置编码机制——对高度、宽度、时间三个维度分别编码,再相加。这样既能适配不同宽高比,又能支持任意长度的视频。针对推理效率问题,采用了线性-二次时间步长调度策略,仅用50步就能逼近1000步采样的效果,推理速度大幅提升。

\

为了进一步提高生成效率,还采用了基于时间平铺的推理方法。生成高分辨率长视频时,直接对整个视频编码解码会遇到内存限制问题。时间平铺将输入视频在时间维度上分割成多个片段,每个片段独立编码解码,再拼接输出。这样不仅降低内存需求,还提高了推理效率。另外,解码阶段使用重叠和混合的方式消除片段边界伪影——在片段之间引入重叠区域并加权平均,确保视频在时间维度上平滑一致。

\

Meta还开源了多个基准测试数据集,包括Movie Gen Video Bench、Movie Gen Edit Bench和Movie Gen Audio Bench,为后续研究者提供了权威的评测工具,有助于加速整个领域的进步。这篇长达92页的论文还介绍了更多关于架构、训练方法、数据管理、评估、并行训练和推理优化以及音频模型的细节。

\

One More Thing

AI视频生成这块,这两天热闹不断。就在Meta发布Movie Gen之前不久,OpenAI Sora主创之一Tim Brooks跳槽谷歌DeepMind,继续视频生成和世界模拟器方面的工作。

\

这让人联想到当年谷歌迟迟不推出大模型应用,Transformer八个作者纷纷出走。如今OpenAI迟迟发布不了Sora,主要作者也离开了。不过也有人认为,Tim Brooks选择现在离开,可能说明他在OpenAI的主要工作已经完成,这也让人开始猜测:Sora的另一位主创Bill Peebles至今未发声,背后是否有更多故事?

\

现在Meta放出了带有视频编辑功能的模型,再加上10月1日Pika 1.5更新主打给视频中物体加上融化、膨胀、挤压等物理特效。不难看出,AI视频生成的下半场,要开始卷向AI视频编辑了。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc