热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >CogVideoX,开源了!

CogVideoX,开源了!

来源:互联网 更新时间:2026-08-21 14:35

随着大模型技术的持续演进,视频生成赛道终于迎来了商业化落地的关键节点。Sora、Gen-3这类闭源模型已经展示了令人惊叹的能力,但开源社区却一直缺少一个能真正扛起“商业级应用”大旗的视频生成模型。直到最近,智谱AI终于出手——他们将与「清影」同源的CogVideoX系列模型正式开源,目标很明确:让每一位开发者、每一家企业都能亲手打造属于自己的视频生成工具,加速整个行业的迭代。 目前开源的版本是CogVideoX-2B,参数规模适中,但表现相当亮眼。在FP-16精度下,推理仅需18GB显存,微调则需要40GB显存。这意味着什么?一张4090显卡就能跑推理,一张A6000就能完成微调,对于个人开发者和中小团队来说,这个门槛已经低得相当友好了。模型支持226个token的提示词,可生成6秒视频,帧率8帧/秒,分辨率720×480。当然,这只是起点——视频质量提升的空间还很大,开发者们可以在提示词优化、视频长度、帧率、分辨率、场景微调以及各种周边功能上尽情发挥。更大的模型已经在路上,值得持续关注。

模型

CogVideoX,开源了!

VAE

视频数据天然带着空间和时间两个维度,数据量和计算负担都比图像大得多。为了高效压缩,我们采用了基于3D变分自编码器(3D VAE)的方案——用三维卷积同时压缩空间和时间,从而实现更高的压缩率和更好的重建质量。 模型结构包含编码器、解码器和潜在空间正则化器,通过四个阶段的下采样和上采样来完成压缩。其中时间因果卷积保证了信息的因果性,减少了通信开销。为了应对大规模视频处理,还引入了上下文并行技术。实验中发现,大分辨率编码相对容易泛化,但增加帧数挑战更大。因此训练采用两阶段策略:先在较低帧率和小批量上训练,再通过上下文并行在更高帧率上微调。损失函数结合了L2损失、LPIPS感知损失和3D判别器的GAN损失,确保输出质量。

专家 Transformer

整个流程是这样的:先用VAE编码器将视频压缩到潜在空间,然后将其分割成块并展成长序列嵌入z_vision。同时用T5将文本输入编码为z_text,两者沿序列维度拼接后,送入专家Transformer块堆栈处理。最后反向拼接恢复原始潜在空间形状,通过VAE解码重建视频。

Data

高质量训练数据是视频生成模型的核心。视频可能因为人工编辑或拍摄问题而失真,因此我们开发了一套负面标签体系,专门用于识别和排除低质量视频——比如过度编辑、运动不连贯、画质低下、讲座式、文本主导、屏幕噪音等。通过video-llama训练的过滤器,我们标注并筛选了20,000个视频数据点。同时计算光流和美学分数,动态调整阈值,确保生成视频的视觉质量。 视频数据通常缺少文本描述,需要转化为字幕供模型训练。现有视频字幕数据集往往过短,无法全面描述内容。我们设计了一套从图像字幕生成视频字幕的管道,并微调了端到端的视频字幕模型以获得更密集的字幕。具体做法是:用Panda70M生成简短字幕,用CogView3生成密集图像字幕,再用GPT-4总结生成最终短视频描述。此外还微调了一个基于CogVLM2-Video和Llama 3的CogVLM2-Caption模型,用密集字幕数据训练,从而加速字幕生成过程。

性能

为了评估文本到视频的生成质量,我们使用了VBench中的多个指标(人类动作、场景、动态程度等),同时引入两个额外工具:Devil中的Dynamic Quality和Chrono-Magic中的GPT4o-MT Score,它们专门衡量视频的动态特性。结果如下表所示(注意图片位置保留)。



我们已经验证了scaling law在视频生成方面的有效性。未来,在规模不断扩大的数据量和模型参数下,我们将继续探索更具突破性的模型架构、更高效的信息压缩方法,以及更深层次的文本与视频融合方式。
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc