来源:互联网 更新时间:2026-06-14 15:05
多模态AI的战场,正从单一的理解或生成,转向“理解-生成-编辑”一体化的闭环。最近,字节跳动推出的Mamoda2.5,就是这个趋势下一个颇具分量的选手。它不仅仅是一个模型,更像是一个集成了多种能力的“视觉工厂”。
简单来说,Mamoda2.5是字节跳动基于128专家细粒度DiT-MoE架构打造的统一多模态AR-Diffusion模型。它的总参数量达到了250亿,但得益于巧妙的稀疏激活设计,每次推理实际激活的参数只有大约30亿。这个设计很关键,它让模型在保持巨大容量的同时,把计算成本压了下来。
它的能力相当全面:既能理解图像和视频中的内容,也能根据文字生成高质量的图片和720p视频,还能对已有的图像视频进行精细编辑。更值得一提的是,在OpenVE-Bench、FiVE-Bench、Reco-Bench这几个权威的视频编辑榜单上,它都拿下了第一。而且,生成720p视频的速度,比同类模型快了12到18倍。
Mamoda2.5的性能背后,是一系列精巧的技术设计。我们来拆解一下它的核心组件。
| 对比维度 | Mamoda2.5 | Wan2.2 | VInO |
|---|---|---|---|
发布方 |
字节跳动 | 阿里开源社区 | — |
核心定位 |
统一理解+生成+编辑 | 专用文生视频 | 专用视频编辑 |
架构 |
DiT-MoE(25B总参/3B激活) | Dense DiT(28B-A14B) | MMDiT + VLM(13B) |
文生视频 |
支持,VBench 2.0 顶级 | 支持,开源标杆 | 不支持 |
视频编辑 |
SOTA,三榜第一 |
不支持 | 支持,开源前列 |
图像生成/编辑 |
支持 |
不支持 | 不支持 |
多模态理解 |
支持(Qwen3-VL-8B) |
不支持 | 有限 |
统一单模型 |
是 |
否 | 是(仅限编辑) |
720p生成速度 |
111秒 |
1366秒 | — |
480p编辑延迟 |
9秒(蒸馏版) |
— | 882秒 |
开源状态 |
论文已发,权重待开源 | 已开源 | 已开源 |
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
腾讯ima怎么创建共享知识库?
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
WorkBuddy微信版怎么获得积分?
5000元起的鼠标哪个最值得入手?
车载冰箱重置到出厂设置几步?
比特币 2025 年价格预测:BTC 的未来走势
笔记本移动电源推荐哪款?
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
腾讯ima知识库怎么分类管理?
WorkBuddy积分怎么获得?
Aptos(APT)2026-2032年价格预测与历史走势梳理
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc