热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >多模态大模型技术白皮书

多模态大模型技术白皮书

来源:互联网 更新时间:2026-08-26 13:49

多模态大模型,顾名思义,就是让机器学会同时处理多种信息通道——文本、图像、语音、视频,甚至触觉信号。它不再是单一模态的“单打独斗”,而是将不同感知途径的信息融合起来,实现更全面的理解和生成能力。

1.1 多模态大模型的技术体系

目前,这个领域的技术路线大致可以分为四类:面向理解任务的、面向生成任务的、兼顾理解与生成的,以及知识增强型的。

1.1.1 面向理解任务的多模态大模型

这类模型的核心是让机器“看懂”并“读懂”信息。其结构基石通常是基于Transformer的编码器,具体又分为单流和多流两种架构。

单流结构

好比一个中央处理器,所有模态的数据(比如文本和图像)都先拼接到一起,然后由一个共享的Transformer网络统一处理。而

多流结构

则像是多部门协作:不同模态的数据先各自由独立的Transformer网络编码处理,处理完了,再通过一些交互机制进行特征融合。

多流结构里有个典型代表——ViLBERT。它采用双流Transformer,文本和图像先分别进入各自的编码器,之后通过一个互注意力Transformer(Co-Attention Transformer)层进行融合。这样得到的文本-图像特征,可以灵活地应用到视觉问答、图像描述生成等任务中。

另一个不得不提的多流代表是OpenAI的

CLIP模型

。它使用两个独立的编码网络分别抽取图像和文本特征,再通过对比学习将两者的特征嵌入到同一个共享的语义空间里。CLIP的厉害之处在于,它基于4亿图文对进行训练,能从自然语言监督中高效学习视觉概念,获得了泛化性能极强的零样本分类能力。与CLIP类似的还有ALIGN,它使用对比损失训练一个简单的双编码器,数据集规模更大——超过10亿个噪声图像-文本对。

如果把视野扩展到视频领域,VATT则是一个针对视频-文本-音频数据的多流模型。它的思路与CLIP类似:先将各模态数据线性投影为特征向量,再分别送入Transformer编码器,最后在语义分层的不同粒度空间里通过对比学习来训练。

图 3-1 CLIP模型架构图

再来看单流结构。它的典型代表是

VL-BERT

,它将图像的描述文本和关键物体的区域特征拼接后作为BERT网络的输入。训练时,模型需要学习预测被掩码掉的文本和图像部分,从而建立起跨模态的关联。另一个代表性方法是

UNITER

,它采用多任务的多模态预训练策略,特别增加了一个单词与图像区域的匹配模块,以建立更细粒度的图文关联。

在视频领域,单流结构的代表有

VideoBERT

ActBERT

。前者融合文本和视频作为BERT的输入,后者则采用全局-局部关系的建模方法,不仅利用了文本和视频的全局信息,还加入了视频帧中的局部信息来强化理解。

当然,上述两类结构是主流基础,但研究者们并没有止步。不少工作开始在预训练任务上做文章,比如引入更多预训练任务,或者设计统一架构去训练所有任务。

Florence

就是其中之一,它的重点在于如何让模型更好地适应各种下游任务,设计了一个由多模态大模型和适应模型组成的工作流。具体来说,它使用动态头部适配器将视觉特征从场景扩展到对象,用CoSwin适配器学习视频表示,再用METER适配器去应对那些依赖细粒度视觉-语言表示的V&L任务。

1.1.2 面向生成任务的多模态大模型

这类模型的目标是“创作”——根据输入的文本、图像等模态信息,生成全新的图片、视频、音频、甚至3D分子结构。目前的主流方法集中在序列生成模型和扩散模型这两大阵营。

在序列生成模型中,OpenAI的

DALL-E

是一个里程碑。它基于4亿图文对训练,采用VQVAE图像离散自编码器和GPT的组合结构,在以文生图任务上取得了突破性的生成质量和泛化能力,被称为“图像版GPT”。

国内方面,北京智源研究院的

CogView

模型(如图3-2)结构与DALL-E类似,但面向中文环境。它在文本控制的样式学习、服装设计和图像超分等任务上同样表现出色。在文本生成方向上,序列生成模型依然是主流方案,比如

GIT

,它统一了图像/视频的描述和问答等V&L任务,包含一个图像编码器和一个文本解码器,以自回归方式生成文本。

图 3-2 CogView 模型架构图

扩散模型的工作原理很有意思:先通过连续添加高斯噪声来“破坏”训练数据,然后学习反转这个噪声过程,从而恢复出原始数据。它的代表性方法

LDM

,先压缩图像的像素信息得到隐特征表达,再用扩散模型来建模这个隐特征的分布。在此基础上,

Stable Diffusion

将LDM拓展到开放领域的文本至图像生成,成为当前最热门的开源模型之一。

闭源阵营中,OpenAI的

DALL-E 2

和谷歌的

Imagen

是两大代表。DALL-E 2先训练一个扩散解码器来反转CLIP图像编码器,再训练一个独立的映射模型,将CLIP的文本特征映射到图像特征空间,从而极大提升了生成图像与输入文本的匹配度。而Imagen则在流程上有所不同:它使用通用语言大模型T5直接编码文本信息,然后用扩散模型将文本表征映射成低分辨率图像,之后通过两个超分辨率扩散模型逐步提升到1024x1024像素。有意思的是,研究发现,基于T5提取的文本特征生成的图像,在细节准确度上比基于CLIP的更高。

图 3-3 Imagen 模型架构图

1.1.3 兼顾理解和生成任务的多模态大模型

Transformer有一个天然特性:编码器通过双向注意力机制学习理解,解码器通过单向注意力机制学习生成。那么,把它们联合起来,就能让模型同时具备这两种能力,从而在更广泛的下游任务上大显身手。

蒙特利尔大学的

VL-T5

模型是典型代表。它将多个多模态任务统一为文本生成任务。具体来说,模型由Transformer编码器和自回归解码器组成,核心创新点在于:针对不同的训练任务和数据,采用不同的输入文本与输出文本构造方式。这样做的好处是,能充分利用不同任务的数据来训练模型,提高泛化性。

图 3-4 VL-T5 模型架构图

另一个典型模型

Unified VLP

则走了一条更简洁的路——让编码器和解码器共享同一个Transformer网络。它通过设置注意力掩码来控制网络扮演的角色:使用双向掩码时就是编码器,可以建模前后文依赖;使用单向掩码时就是解码器,只能看前文。这种共享方式有效减少了参数量。

此外,还可以将语言大模型的文本生成能力与各类模态编码器的感知能力相结合。这类方法以语言大模型为主导,来实现多模态的对齐、融合和交互。背后的逻辑是:文本具有高效的表达效率,能通过语义描述与所有模态建立直接联系;同时,语言大模型在预训练中学习了海量的世界知识,具备潜在理解多模态信息的能力。结构上,这类模型通常由单模态编码器、连接器与语言大模型三部分组成。单模态编码器和语言大模型的参数可以冻结以减少计算量,而连接器可以是简单的线性映射层,也可以是特殊设计的网络模块,比如BLIP-2中的Q-former结构(如图3-5)。

训练过程通常分两阶段:第一阶段,利用大规模弱关联的跨模态数据(如图文、视频-文本、音频-文本数据),基于条件文本生成任务进行语义对齐;第二阶段,通过多模态指令微调提升零样本多模态能力,核心是构造面向多模态任务的指令微调数据,比如多模态对话、详细描述与推理问答等。

图 3-5 BLIP-2 模型架构图

1.1.4 知识增强的多模态大模型

大模型的强大之处在于对大规模数据有卓越的拟合能力,还能学到隐式知识。但为了促进更有意义的理解和预测,还需要将这些隐式知识与显式知识(比如来自知识图谱的结构化信息)联系起来。因此,将知识图谱、场景图、外部知识库等注入大模型,就成了一个重要的研究方向。

在场景图知识的利用上,百度的

ERNIE-ViL

模型是个好例子(如图3-6)。它在视觉-语言模型中引入了由文本解析而来的场景图信息,在预训练中通过掩码场景图中的知识实体和关系,要求模型预测被掩码的信息。这个更细粒度的预训练任务,能让模型更精准地把握图像和文本之间的对齐关系。

在知识图谱方面,

KRISP

是一个典型方法。它结合了隐含知识和明确知识的学习:从无监督语料和有监督训练数据中学到隐含知识,从结构化知识图谱中学习明确的符号化知识。这样一来,模型既能进行隐式知识推理,又能获取符号化的知识表示。

图 3-6 ERNIE-ViL 模型架构图

1.2 多模态大模型的关键技术

这项技术要落地,离不开几个关键环节:预训练数据收集、基础模型构建、自监督学习与模型优化训练,以及下游任务微调。

1.2.1 多模态大模型的网络结构设计

网络架构在多模态预训练中扮演着关键角色。处理图像和文本模态时,通常会采用Transformer或卷积神经网络(CNN)来捕捉复杂关系;而面对事件流数据,脉冲神经网络可能更适合,因为它能有效模拟时序动态。

值得注意的是,随着模型规模增大,大模型展现出强大的记忆能力和性能增益,但复杂度的增加也带来了计算挑战,并可能遇到性能瓶颈。因此,设计更高效的网络结构,比如改进甚至替代Transformer,就成了重要研究方向。

另外,得益于语言大模型涌现的知识与逻辑推理能力,近期一系列多模态大模型开始以语言大模型为核心进行构建。DeepMind的

Flamingo

视觉语言模型就是个代表。它将视觉编码器与语言大模型的参数冻结,通过可学习的融合模块联系起来。模型使用超过20亿对图片-文本、270万对视频-文本,以及430万图文混排的网页数据进行联合训练。Flamingo具备少样本的多模态序列推理能力,无需额外训练就能完成视觉语义描述、视觉问答等多种任务。另一个代表

KOSMOS-1

,将基于Transformer的语言模型作为通用接口,对接视觉感知模块,拥有16亿参数,在多模态语料库上训练后,具备了遵循指令(零样本学习)和在上下文中学习(少样本学习)的能力,能原生处理视觉对话、视觉问答、图像描述生成、光学字符识别等任务。

近期还有一系列模型尝试将图像、视频等感知模块与LLaMA等开源语言大模型对接。

ChatBridge

是其中一个典型,它使用多个并行的感知模块处理图片、音频、视频的特征,然后通过少量预训练参数将这些特征投影到语言大模型的语义空间,使模型具备了灵活感知和理解混合模态信息的能力。

最后,设计更兼容下游任务的网络结构也是关键。引入编码器-解码器结构将多模态理解和生成任务统一到一个框架下,能够更好地支持各种任务,这涉及到跨模态注意力机制、模态间的对齐和翻译,以及更复杂的特征集成策略。

1.2.2 多模态大模型的自监督学习优化

以视觉-语言数据的联合学习为例,目前常用的自监督学习任务主要有以下几种:

1) 掩码语言建模(MLM):

输入文本序列中的某些词被替换成[MASK]标记,模型需要根据可见的多模态上下文来预测这些被遮蔽的词(如图3-7)。这个任务能让模型获取深层次的语言理解,为下游任务打好基础。

图 3-7 掩码语言预测

2) 掩码图像建模(MIM):

输入图像中的部分区域被隐藏或替换成[MASK]标记,模型需要在看到其余图像内容和文本等信息的情况下,预测或还原被遮蔽的区域(如图3-8)。这能促使模型学习图像的视觉特征和多模态上下文关系。

图 3-8 掩码视觉预测

3) 图像-文本匹配(ITM):

前两者旨在建立细粒度对齐,而ITM旨在实现全局对齐。通常使用图文对作为正样本,随机配对作为负样本,通过二分类方法实现匹配(如图3-9)。

图 3-9 图像文本匹配

4) 图像-文本对比学习(ITC):

使用对比学习,将相同样本对的向量表示拉近,不同样本对的推远,以增强图像和文本之间的语义关联性(如图3-10)。

图 3-10 图像-文本对

1.2.3 多模态大模型的下游任务微调适配

多模态大模型的终极目标是适配并提升特定任务的表现。目前,微调适配主要有三种方式:

1) 面向特定任务的模型微调:

将预训练模型的权重作为初始参数,在任务特定数据上进行有监督微调。模型通过学习学习针对具体任务的细粒度特征,来适应特定要求。

2) 联合提示学习的模型微调:

设计契合上游预训练任务的模板,挖掘出预训练模型的潜力,让模型在尽量不需要标注数据的情况下完成下游任务。这种方法节省了训练时间和计算资源。

3) 基于适配器网络的模型微调:

每个任务都有自己独立的适配器层,使得模型可以在不同任务之间共享通用预训练模型的表示,同时在每个任务上进行个性化调整。适配器层通常参数较少,比在整个模型上微调更高效。训练时,预训练模型的参数被冻结,只更新适配器层的参数。

需要留意的是,现有的预训练大方法多通过特征微调或提示学习用于下游任务,未来还需要研究增量学习算法。如何将新模态(比如未来可能出现的新型传感器)引入到已经训练好的多模态模型中,具有重要的现实意义——设计的模型需要足够灵活,才能应对这种不确定性。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc