热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >大视觉语言模型

大视觉语言模型

来源:互联网 更新时间:2026-07-31 13:17

综述:大模型时代的哪个图表问答工具最强?(结尾附工具列表)

发布时间:2024年03月18日

大视觉语言模型

LLM应用 数据可视化

图表,作为数据可视化的核心载体,一直是洞察发现和决策制定的关键。这几年,大模型的爆发式发展,让自动图表理解这件事儿有了质的飞跃。像LLMs这样的基础模型,不仅在NLP领域大杀四方,也开始在图表理解这块地上深耕细作。这篇综述,就是要把大模型框架下,图表理解领域的最新进展、面临的挑战以及未来的路该怎么走,掰开揉碎了讲清楚。

先说说几个核心判断。我们首先得明确,到底什么是图表理解,它的核心问题是什么,以及要深入这个领域,需要哪些基础构件。搞清楚了这些,再看具体的任务和数据集——包括事实问答、开放域问答、标题生成、图表到表格转换、事实核查等等,顺带说说评估标准和用的资源。之后,我们会深入建模策略,聊聊分类方法和生成方法两大流派,以及如何用工具给模型“开外设”。当然,各任务现在的顶尖水平(SOTA)和优化空间,也是重点。最后,专门聊聊挑战和未来,比如特定领域图表的理解困难、评估的不足、以及智能体场景下的局限。总而言之,希望这篇东西能给后续顺着大模型这条路推进图表理解的研究,提供一些有价值的指引。

图表类问答基础模块定义

在深入细节之前,先来建立一个共同的基础。一个自动图表问答系统,通常由这几个核心模块构成:视觉编码器、图表表格转换模块、OCR模块、文本编码器、文本解码器。它们各司其职,又彼此协作。

视觉编码器

:它的任务是从输入的图表图像里,把视觉特征给提出来,理解图上各种图形元素、文字以及它们之间的空间关系。传统做法是直接用视觉编码器,把图像映射成一个视觉特征矩阵。而最近的一些基于大型视觉-语言模型(LVLMs)的方案,比如ChartLlama和ChartAssistant,则多加了额外的投影层,好让文本和视觉的表示能更好地对齐。

图表表格转换模块

:图表背后的原始数据表,是模型理解图表信息的“底牌”。但现实世界里,这张底牌往往拿不到。所以,很多方法都搞了个“图表到表格”的转换模块,把图表图像里的数据表给“榨”出来。提取出的表格,通常会被线性化成一串标记符。

OCR模块

:识别图表图像里的文字,是理解的必经之路。大多数方法都会用OCR系统来干这活儿,顺便还能拿到每个文字的位置信息,也就是边界框——左上角、右下角的坐标,以及宽和高。

文本编码器

:要理解用户问的问题,得有个文本编码器,把问题文本变成一个查询表示矩阵。这个活儿,一般由Transformer编码器或者预训练语言模型里的词嵌入层来干。同样,提取出的表格也能用它编码成一个表示矩阵。

文本解码器

:解码器负责根据已有的上下文,一个词一个词地把预测的答案给“吐”出来。在现有模型里,上下文通常包括图表表示矩阵、查询表示矩阵,以及/或者提取出的表格表示矩阵。

数据集测试任务类型

为了让大家对后续的内容有个清晰的认识,先统一一下几个关键任务的概念:

  • FQA (Factoid Question Answering)

    :事实问题回答
  • OQA (Open-domain Question Answering)

    :开放域问题回答
  • CAP (Captioning)

    :图表标题生成
  • C2T (Chart-to-Table)

    :图表到表格
  • FC (Fact-checking)

    :事实检查
  • FEC (Factual Error Correction)

    :事实错误修正
  • FID (Factual Inconsistency Detection)

    :事实不一致检测

图表问题回答

:这个任务很简单,就是让模型看图回答问题。难点在哪儿?在于模型得真正理解数据背后的趋势和关系。之前的研究主要关注两类问题:事实问题和开放式问题。事实问题的答案往往是名词、动词或副词,比如坐标轴上的数值、趋势是“增加”还是“减少”、变化的“幅度”之类。而开放问题,答案往往是一整段话。

图表标题生成

:也叫图表总结,目标是给一张图生成一段描述性的文字。这段文字得抓住数据可视化想传达的核心洞察或信息摘要,不能只是罗列数据。

图表到表格转换

:这要求模型看懂视觉数据,然后把它转成表格格式。说白了,就是从图表图像里把数据和系列关系给“抠”出来,再用结构化表格呈现。

图表事实检查

:这个任务的核心是验证,一个给定的说法到底跟图表上的信息是不是一回事。这对跨媒体查错、防止假消息很有用。目前公开的专门数据集只有ChartFC和ChartCheck。跟通常的事实检查文献不太一样,这两个数据集只考虑“支持”和“反驳”两种标签,忽略了信息不足的情况。这跟图表字幕的事实不一致检测任务基本是一回事,区别仅在于文本输入:图表事实检查用的是人写的说法,而事实不一致检测用的是机器生成的字幕。

图表字幕事实错误修正

:这是事实检查的延伸版。模型拿到一张图和一个可能跟它对不上的字幕,不仅要找出这些事实错误,还得把它们纠正过来,确保修正后的字幕能如实反映图表信息。

实现方案

具体怎么干?主要分两大类:分类方法和模型方法。

基于分类的方法

局限性很明显,它只能用在词汇表固定或输出是单词标记的任务上。像那种需要大段文字输出的图表理解任务,它基本就干不了。所以,最新的方法清一色都走生成式路线,并且越来越向集成化、端到端可训练的框架靠拢。

说到

基于模型的方案

,又可以分为三个子类:非预训练模型、预训练模型,以及大型视觉语言模型。这个我们后面会专门聊。

工具增强

工具增强,说白了就是给模型请外援,用来补足它自身能力上的短板,比如视觉表示能力不够。在图表理解这个领域,外援主要干一件事:从图表里把关键信息提取出来,交给更牛的模型去处理。早期的外援是OCR系统,专门用来从图像里抽文字。最近的趋势是转向端到端的预训练视觉-语言模型,比如Donut和Pix2Struct,它们已经可以不依赖OCR了。

性能

性能对比表格

从上面的表格能看出来,各任务和数据集上的顶尖水平基本都集中在预训练模型和LVLMs手上。这说明,用更大规模的视觉和语言模型,再配合预训练或者指令微调技术,确实能大幅提升图表理解模型的能力。

另外,那些需要生成长段文本的任务(比如图表字幕生成),显然比那些有标准答案的任务(比如图表问答)要难得多。这也是自然的,毕竟开放生成的难度远高于在既定范围内做选择。

使用生成式模型方法的模型

既然生成式方法是主流,那我们来看看具体有哪些代表性的工作。

非预训练模型

  • SciCap: Generating Captions for Scientific Figures.

  • Figure Captioning with Relation Maps for Reasoning.

  • Chart-to-Text: Generating Natural Language Descriptions for Charts by Adapting the Transformer Model.

预训练模型

  • Enhanced Chart Understanding via Visual Language Pre-training on Plot Table Pairs.

  • MatCha: Enhancing Visual Language Pretraining with Math Reasoning and Chart Derendering.

  • UniChart: A Universal Vision-language Pretrained Model for Chart Comprehension and Reasoning.

  • Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding.

工具增强

  • DePlot: One-shot visual language reasoning by plot-to-table translation.

  • Do LVLMs Understand Charts? Analyzing and Correcting Factual Errors in Chart Captioning.

  • Do LLMs Work on Charts? Designing Few-Shot Prompts for Chart Question Answering and Summarization.

  • DOMINO: A Dual-System for Multi-step Visual Language Reasoning.

  • StructChart: Perception, Structuring, Reasoning for Visual Chart Understanding.

大视觉语言模型

专为图表理解设计

  • ChartLlama: A Multimodal LLM for Chart Understanding and Generation.

  • MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning.

  • ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning.

  • ChartInstruct: Instruction Tuning for Chart Comprehension and Reasoning.

  • ChartX & ChartVLM: A Versatile Benchmark and Foundation Model for Complicated Chart Reasoning.

  • FigurA11y: AI Assistance for Writing Scientific Alt Text.

  • Chart-based Reasoning: Transferring Capabilities from LLMs to VLMs.

通用模型

  • Visual Instruction Tuning.

  • mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality.

  • mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration.

  • SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models.

  • Gemini: A Family of Highly Capable Multimodal Models.

  • GPT-4V.

  • Introducing the next generation of Claude (Claude 3).

文中引用的相关研究及其不断涌现的新成果,将持续更新于:https://github.com/khuangaf/Awesome-Chart-Understanding。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc