来源:互联网 更新时间:2026-08-02 13:38
过去一年多,GPT-4V 这类多模态大语言模型(Multimodal Large Language Model,简称 MLLM)的发展速度确实令人瞩目。正因如此,我们特意对这篇综述做了全面升级,目的在于帮助大家更清晰地把握这一领域的当前进展与未来可能。
MLLM 是从近年来大语言模型(Large Language Model, LLM)框架下生长出来的。它一方面继承了 LLM 强大的泛化与推理能力,另一方面又着力将多模态信息的处理能力吸纳进来。与此前的多模态方法相比——不管是 CLIP 那种判别式路线,还是 OFA 这类生成式模型——新登场的 MLLM 展现出了两个极其鲜明的特征。一是

整篇综述从 MLLM 的基础形式出发,逐步展开到它的拓展延伸以及与之相关的研究课题。具体说来,大致涵盖三个方面:首先是 MLLM 的基础构成与相关概念,包括架构、训练策略、数据和评测;然后是 MLLM 的拓展延伸,比如对输入输出粒度、模态、语言和场景的支持;最后则是 MLLM 的几个相关研究课题,例如多模态幻觉、多模态上下文学习(M-ICL)、多模态思维链(M-CoT)以及 LLM 辅助的视觉推理(LA VR)。
对于最常见的多模态输入-文本输出型 MLLM,它的架构通常包含三部分:
模态编码器先把原始信息(如图像)转成特征,然后连接器再把这些特征处理成 LLM 容易理解的形式,也就是视觉 Token。LLM 则扮演“大脑”的角色,综合这些信息进行理解和推理,最终生成回答。有趣的是,这三部分的参数量并不平均。拿 Qwen-VL[1] 来说,作为“大脑”的 LLM 参数量为 7.7B,大约占总量 80.2%;视觉编码器次之,1.9B,约占 19.7%;而连接器的参数量仅有 0.08B,几乎都可以忽略不计。
对视觉编码器而言,提高输入分辨率是最直接的性能增益方式。一种做法是直接拉升分辨率,这时候必须放开视觉编码器让它训练去适应更高的分辨率,典型如 Qwen-VL[1]。另一种做法则巧妙得多:把大分辨率图片切成若干子图,每一块再以低分辨率送进视觉编码器,实则间接实现了高分辨率输入的效果,Monkey[2] 就是这种思路的代表。
在预训练 LLM 的选择上,常见的有 LLaMA[3] 系列、Qwen[4] 系列和 InternLM[5] 系列。前者主要面向英文,后两者在中英双语上的表现更为均衡。性能方面,扩大 LLM 的参数量带来的增益相当显著。LLaVA-NeXT[6] 在 7B、13B、34B 规模的 LLM 上做过实验,发现随着 LLM 的规模增大,各个 benchmark 上的指标都在明显提升;更厉害的是,在 34B 模型上甚至涌现出了 zero-shot 的中文能力。当然,除了直接增大参数规模,最近大火的 MoE 架构提供了一条更高效的路径——通过稀疏计算,在不增加实际计算参数量的前提下提升总参数量。
相比编码器和 LLM,连接器的重要性似乎约等于不那么“重头”。MM1[7] 的实验就表明,连接器的类型还不如视觉 Token 的数量(决定 LLM 能用到多少视觉信息)以及图片分辨率(决定视觉编码器能输入多少信息)重要。
MLLM 的训练过程大致分为三个阶段:
早期工作在第一阶段大多依赖粗粒度的图文对数据,比如 LAION-5B。这类数据从互联网上扒下来,规模确实够大(动辄数十亿),但噪声多、文本短,容易影响对齐效果。后续的工作开始探索使用更干净、文本内容更丰富的数据来做对齐。例如 ShareGPT4V[8],直接拿 GPT-4V 生成的详细描述进行细粒度对齐,效果明显更好。但问题在于,GPT-4V 是收费的,因此这种高质量数据的规模通常不大(只有数百万量级)。数据规模一受限,里面包含的世界知识自然也就有限——比如它不一定能识别出画面中的建筑是广州塔。而这类世界知识,往往还要靠那些规模庞大但略粗糙的粗粒度图文对来提供。
第二阶段的微调数据来源不少:既可以是 VQA、OCR 等任务数据,也可以是 GPT-4V 生成的数据(比如问答对)。后者虽然能生成更复杂、更多样化的指令,但成本也随之大幅上升。值得一提的是,这一阶段通常还会混入一部分纯文本对话数据,它们充当了正则化措施的角色,帮助模型保留 LLM 原有的能力和内嵌知识。
第三阶段的数据主要是针对回答的偏好数据。这类数据通常依赖人工标注,成本不菲。不过近期也已经出现了一些自动化的方法,比如 Silkie[9],通过调用 GPT-4V 来收集偏好排序数据。
除了提升模型的基础能力(比如支持什么形式的输入/输出、性能指标有没有提高),其实还有很多有趣的问题和尚未开拓的方向值得关注。这篇综述重点介绍了多模态幻觉、多模态上下文学习(M-ICL)、多模态思维链(M-CoT)以及 LLM 辅助的视觉推理(LA VR)。
基于当前研究现状,我们将挑战与可能的未来方向总结如下:
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
Ondo将于今日上线股票永续合约
暗黑4S14野蛮人终局BD攻略
区块链OTC交易所有哪几家比较正规?
Binance新增15种bStocks代币化证券为杠杆抵押资产
Meme币DOGS今晚上线!开局就解锁91%代币是否带来风险?
忍者必须死3极刃血影角色介绍
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
余姚的路虎4s店在哪个位置
彩云天气怎么看分钟级降雨预报 彩云天气精准预报方法【技巧】
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
合集38个项目筹集5.406亿美元 Figure融资2亿
国家养老服务消费补贴上线京东
英伟达机器人团队在京沪深招人,聚焦具身智能等四大领域
一站式PDF转Markdown解决方案PDF3MD
硬刚苹果!华为9月新品阵容出炉:Mate 90系列、全新三折叠
微软Copilot AI漏洞可致敏感数据泄露,企业用户需及时更新
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc