热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >多模态大语言模型综述

多模态大语言模型综述

来源:互联网 更新时间:2026-08-02 13:38

过去一年多,GPT-4V 这类多模态大语言模型(Multimodal Large Language Model,简称 MLLM)的发展速度确实令人瞩目。正因如此,我们特意对这篇综述做了全面升级,目的在于帮助大家更清晰地把握这一领域的当前进展与未来可能。

MLLM 是从近年来大语言模型(Large Language Model, LLM)框架下生长出来的。它一方面继承了 LLM 强大的泛化与推理能力,另一方面又着力将多模态信息的处理能力吸纳进来。与此前的多模态方法相比——不管是 CLIP 那种判别式路线,还是 OFA 这类生成式模型——新登场的 MLLM 展现出了两个极其鲜明的特征。一是

模型规模大

:参数数量动辄以十亿计,更大的参数量自然意味着更强的潜力。二是

全新的训练范式

:为了让这些庞大参数真正活起来,MLLM 引入了多模态预训练、多模态指令微调等新范式,相应的数据集构建方式和评测方法也随之进化。在这两大特质的加持下,一些以往其他多模态模型想都不敢想的能力开始涌现:比如给定一张图片,模型可以直接进行 OCRFree 的数学推理;又比如给定一张图片,它能一个故事讲得有模有样,甚至还能看懂那些画面配文的“梗”到底藏在哪。

多模态大语言模型综述

  • 论文链接:https://arxiv.org/pdf/2306.13549.pdf
  • 项目链接(每日更新最新论文):https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models

整篇综述从 MLLM 的基础形式出发,逐步展开到它的拓展延伸以及与之相关的研究课题。具体说来,大致涵盖三个方面:首先是 MLLM 的基础构成与相关概念,包括架构、训练策略、数据和评测;然后是 MLLM 的拓展延伸,比如对输入输出粒度、模态、语言和场景的支持;最后则是 MLLM 的几个相关研究课题,例如多模态幻觉、多模态上下文学习(M-ICL)、多模态思维链(M-CoT)以及 LLM 辅助的视觉推理(LA VR)。

架构

对于最常见的多模态输入-文本输出型 MLLM,它的架构通常包含三部分:

编码器

连接器

LLM

。如果你想让它输出更多模态的内容(比如图片、音频、视频),就得另外再搭一个

生成器

,具体结构如下图。

模态编码器先把原始信息(如图像)转成特征,然后连接器再把这些特征处理成 LLM 容易理解的形式,也就是视觉 Token。LLM 则扮演“大脑”的角色,综合这些信息进行理解和推理,最终生成回答。有趣的是,这三部分的参数量并不平均。拿 Qwen-VL[1] 来说,作为“大脑”的 LLM 参数量为 7.7B,大约占总量 80.2%;视觉编码器次之,1.9B,约占 19.7%;而连接器的参数量仅有 0.08B,几乎都可以忽略不计。

对视觉编码器而言,提高输入分辨率是最直接的性能增益方式。一种做法是直接拉升分辨率,这时候必须放开视觉编码器让它训练去适应更高的分辨率,典型如 Qwen-VL[1]。另一种做法则巧妙得多:把大分辨率图片切成若干子图,每一块再以低分辨率送进视觉编码器,实则间接实现了高分辨率输入的效果,Monkey[2] 就是这种思路的代表。

在预训练 LLM 的选择上,常见的有 LLaMA[3] 系列、Qwen[4] 系列和 InternLM[5] 系列。前者主要面向英文,后两者在中英双语上的表现更为均衡。性能方面,扩大 LLM 的参数量带来的增益相当显著。LLaVA-NeXT[6] 在 7B、13B、34B 规模的 LLM 上做过实验,发现随着 LLM 的规模增大,各个 benchmark 上的指标都在明显提升;更厉害的是,在 34B 模型上甚至涌现出了 zero-shot 的中文能力。当然,除了直接增大参数规模,最近大火的 MoE 架构提供了一条更高效的路径——通过稀疏计算,在不增加实际计算参数量的前提下提升总参数量。

相比编码器和 LLM,连接器的重要性似乎约等于不那么“重头”。MM1[7] 的实验就表明,连接器的类型还不如视觉 Token 的数量(决定 LLM 能用到多少视觉信息)以及图片分辨率(决定视觉编码器能输入多少信息)重要。

数据与训练

MLLM 的训练过程大致分为三个阶段:

预训练

指令微调

对齐微调

。预训练阶段的目标是通过大量配对数据,把图片信息对齐到 LLM 的表征空间,简单来说,就是帮 LLM 学会“看”视觉 Token。指令微调阶段则借助多样化的任务数据,让模型在下游任务上的表现以及理解和执行指令的能力进一步提升。到了对齐微调阶段,通常会用强化学习来让模型输出符合人类价值观,或者符合某些特定要求(比如产生更少的幻觉)。

早期工作在第一阶段大多依赖粗粒度的图文对数据,比如 LAION-5B。这类数据从互联网上扒下来,规模确实够大(动辄数十亿),但噪声多、文本短,容易影响对齐效果。后续的工作开始探索使用更干净、文本内容更丰富的数据来做对齐。例如 ShareGPT4V[8],直接拿 GPT-4V 生成的详细描述进行细粒度对齐,效果明显更好。但问题在于,GPT-4V 是收费的,因此这种高质量数据的规模通常不大(只有数百万量级)。数据规模一受限,里面包含的世界知识自然也就有限——比如它不一定能识别出画面中的建筑是广州塔。而这类世界知识,往往还要靠那些规模庞大但略粗糙的粗粒度图文对来提供。

第二阶段的微调数据来源不少:既可以是 VQA、OCR 等任务数据,也可以是 GPT-4V 生成的数据(比如问答对)。后者虽然能生成更复杂、更多样化的指令,但成本也随之大幅上升。值得一提的是,这一阶段通常还会混入一部分纯文本对话数据,它们充当了正则化措施的角色,帮助模型保留 LLM 原有的能力和内嵌知识。

第三阶段的数据主要是针对回答的偏好数据。这类数据通常依赖人工标注,成本不菲。不过近期也已经出现了一些自动化的方法,比如 Silkie[9],通过调用 GPT-4V 来收集偏好排序数据。

其他技术方向

除了提升模型的基础能力(比如支持什么形式的输入/输出、性能指标有没有提高),其实还有很多有趣的问题和尚未开拓的方向值得关注。这篇综述重点介绍了多模态幻觉、多模态上下文学习(M-ICL)、多模态思维链(M-CoT)以及 LLM 辅助的视觉推理(LA VR)。

多模态幻觉

,说白了就是模型生成的回答与图片内容对不上。视觉和文本本质上是两种异构的信息,要让它们完全对齐本身就极具挑战。提高图像分辨率和训练数据质量是两种最直接的消减手段,但真正要从根本上解决问题,还得在原理层面深挖:比如目前的视觉信息 Token 化方法、多模态对齐范式、多模态数据和 LLM 内嵌知识之间潜在的冲突,到底对幻觉产生多大的影响,这些都远未搞清楚。

多模态上下文学习

是一种少样本学习技术:通过给模型提供少量问答样例,它可以迅速举一反三,在 few-shot 场景中表现出色。关键就在于让模型学会有效关注上下文,并把内在的问题模式泛化到新的任务上。Flamingo[10] 是这方面的代表性工作,通过图文交错的数据训练来增强上下文关注能力。不过目前多模态上下文学习的研究还相当初步,还有很多潜力等待释放。

多模态思维链

的想法听起来很自然:把复杂问题分解为几个更简单的子问题,逐个解决后再汇总。但相比纯文本推理,多模态推理涉及的信息源更多、逻辑关系也更复杂,实际做起来要复杂得多。目前这方面的研究同样寥寥。

LLM 辅助的视觉推理

则致力于利用 LLM 强大的内嵌知识与能力,再借助其他工具来设计各种视觉推理系统,以解决现实问题。跟那种端到端训练单一模型的逻辑不同,这类方法更关注如何通过免训练的方式扩展和强化 LLM 的能力,最终搭建出一个综合性的系统。

挑战和未来方向

基于当前研究现状,我们将挑战与可能的未来方向总结如下:

  • 现有 MLLM 在处理多模态长上下文时,能力还远远不够。这一点在长视频理解、图文交错内容理解(比如长文档里既有图像又有文本)等任务上表现得尤为突出。以 Gemini 1.5 Pro 为代表的 MLLM 已经在长视频理解领域掀起了热潮,但多模态图文交错阅读理解目前仍然相对空白,很可能成为下一波研究热点。
  • MLLM 在服从复杂指令上的能力还有明显短板。GPT-4V 能够理解复杂的指令并生成包含推理信息的问答对,但其他模型在同领域的表现则逊色不少,提升空间依然很大。
  • 多模态上下文学习和思维链的研究仍然停留在初步阶段,相关能力也普遍较弱。底层机制和具体能力提升方面的研究都亟待突破。
  • 开发基于 MLLM 的智能体是一个非常热门的方向。但要实现这类应用,模型的感知、推理和规划能力必须全面上一个台阶。
  • 安全问题同样需要高度警惕。MLLM 容易受到恶意攻击,进而生成有偏甚至不良的回答。这方面的研究仍有大片空白。
  • 目前训练 MLLM 时,LLM 通常都会被解冻参与训练。虽然训练过程中也会加入部分单模态文本数据,但多模态和单模态数据放在一起大规模训练,到底对彼此是增益还是损害,目前仍然缺乏系统深入的研究。
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc