热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >大模型能看懂图片的弦外之音吗?多模态大模型新基准II-Bench

大模型能看懂图片的弦外之音吗?多模态大模型新基准II-Bench

来源:互联网 更新时间:2026-08-10 17:32

背景引入

人工智能发展到了今天,大模型的感知能力确实令人咋舌。但话说回来,它们真的能像人类一样,一眼看透一张图背后的深层含义吗?这可不是个简单的问题。为了摸清多模态大模型和人类认知之间的那层窗户纸,来自中科院深圳先进院、M-A-P、华中科技大学、零一万物、滑铁卢大学等多家机构的研究者们,联手打造了一个全新的评测基准——II-Bench。简单来说,这是第一个专门用来考察多模态大模型(MLLMs)能不能看懂“图像隐喻”的综合性测试。

在多模态大模型的世界里,

图像隐喻理解(Image Implication Understanding)

正成为一个全新的硬骨头。这活儿可不光是认出图里有个苹果或者有个人,它要求模型具备多跳逻辑推理能力,甚至还得懂一点“心智理论(ToM)”,这可是属于人类的高级认知技能。跟普通的图像识别比起来,图像隐喻理解需要模型捕捉到画面里的隐喻、象征,甚至是一些细微到几乎不可言说的情感表达。这无疑是对MLLMs的一次真正考验。

II-Bench

为了全面评估这些模型的高级感知能力,研究团队下了一番苦功来打造II-Bench数据集。流程相当严谨:从20,150张原始图片开始,经过图像去重、文本与图像比例控制、人工审核这三阶段的严格筛选,最终只保留了1,222张图片和1,434个问题。这个筛选比例,本身就说明了高质量隐喻数据的稀缺性。

II-Bench的覆盖面也很广,横跨生活、艺术、社会、心理、环境等六大领域,图片类型包括插画、梗图、海报、漫画、Logo和绘画。这种跨领域、跨类别的设计,让评估结果更有说服力,也更真实地反映了模型的理解和推理能力到底几斤几两。

实验

研究团队在II-Bench上对20种主流的MLLMs进行了全方位的测试。为了让结果更客观,他们设计了不同的提问方式,包括标准提示、思维链(CoT)、多样本学习(Few-shot),以及加入图像关键词等。目的就是看看,在不同的“考试条件”下,模型的表现会不会有变化。

评测结果

实验得出的结果,很能说明问题:

1. 首先,MLLMs在理解图像隐含意义这件事上,和人类之间存在肉眼可见的差距。最好模型的准确率是74.8%,而人类平均水平高达90%,最高甚至达到了98%。这中间十几个百分点的差距,几乎是“看得懂画”和“读得懂心”的天堑。

2. 其次,闭源模型整体表现优于开源模型,但领先的优势并不大,两者之间相差仅1%左右。这说明开源社区追赶的速度相当快。

3. 从不同领域来看,模型在艺术和心理这类充满抽象和复杂信息的领域表现最差;而在环境、生活、社会等相对具象、信息直白的领域,表现则要好得多。这很符合直觉——越需要“揣摩人心”的任务,对模型来说就越难。

4. 有意思的是,当在提示中加入图像的情感倾向信息后,模型的得分普遍提高。这反过来暴露了一个问题:模型在理解图像情感方面存在明显短板,如果没人提醒,它很容易对隐含意义产生误解。

5. 思维链(CoT)和多样本学习(Few-shot)这两种常见的提升技巧,在II-Bench上效果并不明显。这或许说明,隐喻理解需要的不是更好的推理路径,而是更底层的语义认知能力。

6. 最后,模型对任务难度的感知基本和人类一致,但在隐含情感的感知上却与人类相悖。具体来说,模型在识别正面情感的隐喻时表现更好,而对中立和负面情感的隐喻则相对迟钝。

错误分析

研究人员对GPT-4V在II-Bench上犯的错误做了深入剖析,把错误分为隐喻理解错误、细节理解错误、细节忽略、表面层次理解、推理错误、拒绝回答和答案提取错误等几类。

其中占比最高的,是“隐喻理解错误”,达到了36%。这就很能说明问题了:尽管MLLMs在表面级别的图像识别上已经很强了,但一旦涉及到图像中的隐喻和象征性含义,理解能力就显得捉襟见肘。背后的原因可能是,隐喻理解通常需要调用文化背景知识和具体情境,而模型目前还缺少这种深层次的语义关联能力。

与此同时,“推理错误”也占了12%。这进一步暴露了模型在处理需要复杂逻辑和多步骤推理任务时的短板,反映出它在高级认知任务上的局限性。

总结

最后简单收个尾:II-Bench是一个专门针对多模态大模型(MLLMs)图像隐喻理解能力的综合性基准。它的广度体现在精心构建的1,222张图片和1,434个问题上,覆盖了生活、艺术、社会、心理、环境等六大领域。

评测结果清晰地告诉我们,当前MLLMs在图像含义理解方面,距离人类还有相当一段距离。II-Bench的目标,正是持续衡量MLLMs在高级感知、推理和理解能力上的进展。未来,这个基准还会继续扩展它所涵盖的领域和任务类型。研究团队相信,II-Bench将进一步激发相关领域的研究和开发,推动人工智能在图像情感理解、隐喻识别和深层次含义推断等高级认知任务上取得突破,让我们离真正具备高级心智理论(ToM)的智能多模态系统,更近一步。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc