热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Meta推出Transfusion:统一Transformer和Diffusion

Meta推出Transfusion:统一Transformer和Diffusion

来源:互联网 更新时间:2026-08-25 13:43

多模态AI的训练,还能怎么玩?Meta最近给出的一个答案,叫做Transfusion。这套全新的训练方法,核心思路其实很直接——不再拘泥于把图像量化成离散的token再送进语言模型,而是直接把语言建模和扩散模型结合起来,用一个Transformer模型同时搞定文本理解和图像生成。

做多模态的人都知道,传统思路是把图像量化成离散的token,然后用语言模型来处理。但这种做法的硬伤在于:量化过程中会丢失信息,生成能力天然受限。而Transfusion的做法是——直接让语言模型和扩散模型在同一个模型中训练,各取所长。这就好比把两种模型的看家本领拼到一起,彼此互补,效果自然不一样。

更具体一点,Meta这次从零开始训练了一个70亿参数的Transfusion模型,用的是海量文本和图像数据。在多个单模态和多模态测试任务上,它的扩展性明显优于传统的量化方法。无论是生成图像还是生成文本,Transfusion的表现都更强。

而且令人印象深刻的是,Transfusion生成的图像质量,已经可以跟专门的图像扩散模型相媲美,同时文本生成能力并未打折。能把两条路线均衡到这个程度,才算真正意义上的多模态。

Transfusion的技术亮点

全局因果注意力 + 图像内部双向注意力

:这是Transfusion的核心设计。全局的因果注意力保证模型能理解文本的顺序逻辑关系,而每张图像内部的双向注意力,则让模型可以吸收整张图的全局信息。后者的加入,是图像质量明显提升的关键——生成出来的图像更逼真,也更连贯。

模态特定的编码和解码层

:为了让模型更高效地处理不同模态的数据,Transfusion引入了模态专用的编码和解码层。比如图像编码层可以借用卷积网络提取特征,文本解码层则用循环网络生成序列。更重要的是,这种设计能把每张图像压缩到64个甚至16个patch——计算量和内存占用都大幅下降。对于大模型训练来说,这个效率提升很关键。

必须指出的是,Meta这一波操作,确实把多模态模型的天花板抬高了。同行们,该加速了。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc