热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >MAGI-2-preview – Sand.ai 开源的多模态视频生成模型

MAGI-2-preview – Sand.ai 开源的多模态视频生成模型

来源:互联网 更新时间:2026-08-06 14:48

MAGI-2-preview是什么

先说说这个模型的身份——MAGI-2-preview来自Sand.ai,是开源社区首个千亿参数级别的MoE(混合专家)多模态视频生成模型。总参数114B,但激活参数只有6B,这意味着什么?简单说,大容量和低计算成本可以兼得。它延续了单流架构,把文本、视频、音频三种模态统一放进同一个Transformer里联合建模,而不是像传统做法那样后期拼接。这个原生多模态设计,让它能直接生成音画同步的内容。在AA视频生成榜单上,它排到了第六。代码和预训练权重已经开放,算是给视频生成领域的高效Scaling路径提供了一个新验证。

MAGI-2-preview – Sand.ai 开源的多模态视频生成模型

MAGI-2-preview的主要功能

来看看它能做什么,核心亮点集中在四个方向:

  • 多模态视频生成

    :文本、图像、视频都能作为输入来生成新视频,关键它还原生融合了音频理解,画面和声音从底层就是一起处理的。
  • MoE稀疏激活

    :114B总参数里只激活6B,推理成本压得很低,部署门槛自然就降下来了。
  • 单流统一架构

    :不是传统那种cross-attention的拼接方式,而是从第一层开始就对画面和声音共同建模,效果更自然。
  • 高效Scaling

    :针对视频生成场景,专门重构了MoE的通信和训练稳定性,解决了超长序列下跨卡通信的瓶颈问题。

MAGI-2-preview的技术原理

技术层面,几个关键点值得拆开来说:

  • MoE混合专家架构

    :总容量114B,每次前向传播只激活6B参数,实现了容量和计算成本的解耦。
  • 单流Transformer

    :文本、视频、音频的token从输入层就进入同一个Transformer,通过自注意力直接交换跨模态信息,比多塔拼接架构更能捕捉音画同步的细节。
  • 分布式通信优化

    :视频超长序列对通信要求很高,这里重新设计了专家并行中的token路由和通信策略,降低了跨GPU的数据传输开销。
  • 训练稳定性方案

    :动态路由、专家负载均衡、多模态数据联合训练,三重保障机制确保训练过程不崩。
MAGI-2-preview – Sand.ai 开源的多模态视频生成模型

(注:原文中有一段微信引导关注的内容已删除,此处不保留)

如何使用MAGI-2-preview

想上手跑一跑?流程很清晰:

  • 环境准备

    :克隆GitHub仓库 SandAI-org/MAGI-2-preview,按README配置依赖。
  • 下载权重

    :从GitHub Releases获取预训练权重。
  • 运行推理

    :修改配置文件与脚本参数,支持 t2v(文本到视频)、i2v(图像到视频)、v2v(视频到视频)三种模式,参考MAGI-1的 run.sh 格式执行。
  • 硬件要求

    :具体配置有待官方文档更新,建议参考MAGI-1的24B多卡H100或4.5B单卡24GB VRAM方案。

MAGI-2-preview的核心优势

和同类模型相比,它有几个很突出的点:

  • 开源可商用

    :采用Apache 2.0协议,预训练权重和推理代码完全开放,商业使用没有法律障碍。
  • 千亿MoE首创

    :全球首个成功开源的千亿级MoE视频生成模型,验证了视频领域Scaling的新路径。
  • 低成本高容量

    :6B激活参数就能驱动114B模型,推理成本远低于同规模稠密模型。
  • 原生多模态

    :单流架构让音视频在模型底层深度融合,避免了后期对齐带来的延迟和质量损失。

MAGI-2-preview的项目地址

  • 项目官网

    :https://sand.ai/blog/magi-2-preview
  • GitHub仓库

    :https://github.com/SandAI-org/MAGI-2-preview
  • HuggingFace模型库

    :https://huggingface.co/sand-ai/MAGI-2-preview

MAGI-2-preview的同类竞品对比

把它和阿里通义实验室的Wan2.7-Video放在一起对比,可以看到各自的侧重:

对比维度 MAGI-2-preview Wan2.7-Video

开发团队

Sand.ai 阿里通义实验室

架构

MoE + 单流自回归 Transformer 3D DiT + MoE + 流匹配

总参数

114B 270B(14B系列)

激活参数

6B 140B

生成范式

自回归 扩散(流匹配)

多模态

原生音视频联合建模(单流统一) 文本/图像/视频/音频全模态输入

视频时长

未明确(延续MAGI-1流式能力) 2-15秒

分辨率

未明确 720P / 1080P

开源协议

Apache 2.0(可商用) 开源(权重开放)

核心能力

高效Scaling、原生多模态视频生成 视频编辑、参考生视频、运镜控制、表情驱动

榜单表现

AA视频生成榜第六 DesignArena V2V榜首

编辑能力

未明确 一句话修改视频、风格迁移、局部替换

从对比可以看出,MAGI-2-preview更强调效率(6B激活 vs 140B)和原生多模态,而Wan2.7-Video在时长、分辨率和编辑能力上更成熟。

MAGI-2-preview的应用场景

基于这些特性,它适合用在哪些地方?

  • 长视频广告与短剧

    :MoE大容量支持复杂叙事建模,可以生成分钟级连贯剧情视频,不用再一段一段拼接。
  • 多模态影视预演

    :原生音频理解能力,能实现配音、音效与画面的同步生成和编辑,拍片前预演很实用。
  • AI视频学术研究

    :开源千亿级视频MoE权重,为学术界提供了一个可复现的Scaling基线,研究门槛大大降低。
  • 企业私有化部署

    :Apache 2.0协议支持金融、医疗等敏感行业构建私有视频生成能力,数据不出门。
  • 实时流媒体生成

    :稀疏激活降低了推理成本,可以支撑低延迟的实时视频生成和直播场景。

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc