热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >哪个大语言模型理解表格信息最厉害???

哪个大语言模型理解表格信息最厉害???

来源:互联网 更新时间:2026-08-10 17:31

# 哪个大语言模型理解表格信息最厉害? 发布时间:2024年06月06日 **图表问答** 打开任意一个网页或者办公文档,你大概率会撞见表格。从股价走势到科研数据,表格以一种极其紧凑的方式承载着大量关键信息。问题是,大语言模型(LLMs)真的能“看懂”这些表格吗?换句话说,当你需要从一个表格里精准捞出答案时,这些模型到底靠不靠谱? 先抛个观点吧:目前来看,情况远没有想象中乐观。即便最强选手表现尚可,整体上,LLMs在处理表格信息检索这件事上,暴露出的短板比预想中要多得多。 最近有一项研究专门盯住了这个问题,并推出了一个名为**TabIS**的评估基准。和以往用文本相似度“蒙混过关”的评估方式不同,TabIS采用了单选题形式,每道题两个选项,直接测试模型能不能从表格中找到正确答案。为了确保题目质量,团队设计了一套高效的选项生成机制,让错误选项具有足够的“欺骗性”,准确率超过92%。整个评估覆盖了12种主流模型,结果虽然在意料之中,但细节值得细品。 --- ## 1. 表格信息检索为什么重要? 先问一个问题:表格这玩意儿,在日常的信息洪流里到底有多重要?这么说吧,光是网页上的表格就已经有数亿个,而企业环境里,类似Excel的电子表格数量更是超过了1.15亿。像金融分析、科学研究这类场景,能不能快速从表格里掏出精准信息,直接决定了工作效率。 LLMs最近几年确实很猛,连信息检索的玩法都变了——从“我给你一堆文档你慢慢搜”变成“你直接给我答案”。但评价LLMs在表格信息检索方面的表现,目前做得还远远不够。过去的研究主要盯着表格到文本的转换(Table-to-Text),让模型把表格翻译成一段描述性文字,然后再评估准确性。问题在于,这个方法本身的评估指标就不够可靠。 为了填补这个空白,TabIS基准应运而生。它设计了三个难度递增的场景:**基础TIS(B-TIS)**、**强调结构理解的TIS(SU-TIS)**,以及**面对多个表格的TIS(M-TIS)**。这三个场景基本覆盖了聊天机器人和增强检索系统中最常见的工况。 --- ## 2. 测评方法 所有的表格都以Markdown格式呈现,模型必须基于上下文表格来回答问题。所有问题都是单选题,温度参数统一设为0,目的是让结果更容易复现。 闭源模型选了三个有代表性的:GPT-3.5、GPT-4和Gemini-Pro。闭源模型虽然性能强,但成本高、隐私风险也不小,所以研究团队同时拉了一批开源模型进来做对比。包括从7亿到70亿参数的Llama2-chat、经过指令调整的Mistral-7b-instruct-v0.2和Mixtral-8x7b-instruct,以及专门针对表格场景微调的**TableLlama-7b**(从Llama2-7b指令调整而来),还有一个从Llama2-70b微调出来的Tulu2-70b-DPO。可以说,这些模型代表了开源社区里当前质量最高、架构最多样的一批选手。 --- ## 3. 测评结果 ![img](http://img.318050.com/uploads/20260530/17801466856a1ae1fdb5bfd720833058.webp) ![img](http://img.318050.com/uploads/20260530/17801466866a1ae1fe440d0716526335.webp) 上表展示了各大模型在TabIS测试集上的表现。讲真,无论闭源还是开源,整体成绩都不太好看。但闭源模型确实压了开源一头:**GPT-4-turbo**以85.9%的平均准确率遥遥领先,紧随其后的是Tulu2-70b-DPO,74.1%。Gemini-pro虽然超越了GPT-3.5,但仍没能追上GPT-4-turbo。 开源模型这边,同一系列里参数大的模型确实表现更好。比如Llama2-chat系列,7b、13b、70b分别拿到50.7%、56.7%和61.9%。但这条规律跨系列就不灵了——**模型规模大并不意味着性能强**,Mistral-instruct的7b版本居然比70b的Llama2-chat还高了1.3个百分点。这个反直觉的现象,或许正是未来研究可以深入挖掘的方向:预训练和对齐策略对表格信息检索的影响,远比我们想象的复杂。 再看各个子任务的表现:所有模型在基础TIS(B-TIS)上都干得更好,而结构理解型(SU-TIS)和多表格型(M-TIS)明显更吃力。SU-TIS只给了突出单元格位置作为线索,没有具体内容,模型只能靠自己理解表格结构;M-TIS则塞进来一个看似相关实则无关的表格,专门给人添乱。 数据来源上也存在差异:所有模型在ToTTo数据集上的表现都优于Hita,幅度从5.8到19.0个百分点不等。原因很简单——ToTTo里的表格基本都是标准格式,没有合并单元格;而Hita里的表格层级复杂,理解难度直接翻倍。 --- ## 4. 为什么表格信息检索难? ### 4.1 表格结构理解——模型的盲区 说到这里,我们得深挖一层:LLMs到底有多“懂”表格的结构? 所谓表格结构理解(Table Structure Understanding,TSU),就是识别表格里的二维布局——比如单元格、行、列的相对位置,并据此定位目标内容的能力。对人类来说,这几乎是本能反应:“第三行第三列那个单元格里写的是什么?”轻轻松松就能答出来。但对LLMs而言,当表格以Markdown或HTML这种序列化格式喂进来时,这事就没那么自然了。 研究人员专门设计了六个基础的查找任务,比如“第三行第三列是什么?”或者“跟‘哈利·波特’同一行的内容是什么?”。如果用人类的标准来衡量,一旦掌握了表格结构和任务要求,无论目标在哪个位置,表现应该高度一致。但LLMs的表现完全不是这么回事。 ![img](http://img.318050.com/uploads/20260530/17801466866a1ae1fecd7ef942435435.webp) 上图展示了六个任务的平均准确率和目标位置变化得分。TSU任务的变化得分是指不同目标位置准确率的标准差。可以清楚地看到,大多数LLMs的表现接近随机水平。即便是最强的GPT-4-turbo,稳定性也堪忧。 这里面有个关键问题需要特别留意:在真实世界的SU-TIS场景里,用户提问时根本没有备选项,模型必须完全依赖位置信息(比如“第三行”)来定位目标区域。换句话说,模型的信息检索表现,很大程度上就取决于它的TSU能力。而目前的表现,显然还差得远。 ### 4.2 伪相关表格——你以为的“相关”可能是坑 ![img](http://img.318050.com/uploads/20260530/17801466876a1ae1ff669cc668251968.webp) 多表格信息检索(M-TIS)引出了一个更隐性的问题:当模型面对伪相关表格时,鲁棒性到底怎么样? 研究团队做了一组对比:分别测量模型在有伪相关表格和没有伪相关表格时的准确度,算出偏差,然后取平均值。结果让人眼前一亮又有些担忧——GPT-3.5-instruct和GPT-4-turbo在准确度和鲁棒性上都表现很好,但两个最强的开源模型Tulu-70b和Mixtral-7b8,反倒出现了鲁棒性最差的情况。 更值得警惕的是另一个趋势:**同一模型系列中,参数越大的版本,在准确度上得分更高,但鲁棒性反而更差**。这个规律在Llama2系列(7b、13b、70b)和Mistral系列(Mistral-7b、Mixtral-8x7b)中都得到了验证。说白了,追求更高的性能,可能正在牺牲模型对抗“伪相关”干扰的能力。这对开源模型来说尤其棘手,未来必须在这方面下功夫。 ### 4.3 难题样本里藏着什么猫腻? 到底哪些问题最让LLMs头疼?研究人员从TabIS中精心挑选了50个典型“难题”,请专家逐一剖析,最终归纳出四大类。 ![img](http://img.318050.com/uploads/20260530/17801466886a1ae200825a7677474764.webp) 分析结果是:第一,模型在识别细节方面依然会出错,尤其容易在那些看似明显、实则暗藏陷阱的选项上翻车(R1、R3)。第二,表格信息检索常常涉及数值推理(R2)和依赖常识判断(R4),这两块恰好是当前LLMs的短板。换句话说,模型不是“看不懂表格”,而是“看懂了但想不通”。 --- ## 5. 局限性 当然,这项研究也有它的局限,需要客观看待。 首先,基准测试采用单选题形式,虽然保证了评估的稳定性,但和真实场景的开放性问答不完全一样。 其次,TabIS目前只设两个选项,对GPT-4这类高准确率模型来说,挑战性可能不够。而且生成问题时使用的模板比较单一,如果问题类型更丰富多元,基准的质量还有提升空间。 再次,研究团队利用GPT-4调整提示并生成伪相关表格,这本身可能引入偏差——尤其是对GPT系列模型而言,它们在数据集构建过程中已经“预习”过类似题目了。 最后,表格全部来自维基百科,存在一个潜在问题:即使不依赖表格提供的信息,LLMs可能本身就已经知道答案,这会影响评估的纯净度。 --- *原文:Uncovering Limitations of Large Language Models in Information Seeking from Tables | arXiv:2406.04113*
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc