热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >RAG及文档理解工具梳理总结:兼看SELF-REASONING框架

RAG及文档理解工具梳理总结:兼看SELF-REASONING框架

来源:互联网 更新时间:2026-08-22 14:40

今天是2024年8月9日,星期五,北京,天气晴。

RAG及文档理解工具梳理总结:兼看SELF-REASONING框架

今天这篇文章主要聊两个话题。一个是回顾一下昨天的大模型进展,另一个是梳理现有文档处理方面的工具合集——最近风向很明显,类似同质化的工具越来越多。

比如,有个叫

MegaParse

https://github.com/QuivrHQ/MegaParse)的新工具,支持Text、PDF、PPT、Excel、CSV、Word等格式。它的做法其实不算新鲜:Office类文件靠各自的库处理——Excel用Pandas解析,Word靠python-docx,PPT依赖python-pptx;同时结合Langchain做文档加载、LlamaIndex的LlamaParse来加强解析效果。对于PDF,则基于UnstructuredIO的非结构化解析能力,再调用LLM(在线用GPT-4o,离线用Llama3等)来处理扫描版,甚至直接用多模态模型(GPT-4o或Claude)把PDF转成PNG再解析。

仔细看,它的优点在于兼容了更多格式,针对不同格式集成了不同处理组件;缺点也很明显:Office文档处理组件基于开源封装(比如Langchain),而PDF页面内容解析完全依赖多模态模型,既费token又慢,效果完全看模型能力,而且没有考虑文档的细粒度布局信息。

话说回来,现在这些工具几乎同质化得厉害,总结下来无非几条路:

  • 1、原始Office文档靠不同格式的组件处理;PDF扫描版本则走2)或3);
  • 2、做版式分析,先把各区域标签抠出来,然后分流——一路走传统OCR,一路调大模型做OCR等;
  • 3、不做版式分析,直接送多模态大模型处理。

另外,再来看一下百度的RAG策略——SELF-REASONING框架,跟Self-RAG的思路很像,值得参考。


一、RAG进展之SELF-REASONING框架

SELF-REASONING框架源自论文

《Improving Retrieval Augmented Language Model with Self-Reasoning》

https://arxiv.org/pdf/2407.19813),其核心是利用LLM自身生成的推理路径来增强检索。

Figure2在文章中给出了一个直观的比较,展示了SELF-REASONING框架如何改善检索增强型语言模型(RALMs)。图示分为三个部分,每种对应一种回答问题的方式:

  • 基本的语言模型(Basic LLMs)

    :最上面部分展示了一个没有检索增强的基本大模型,完全依赖内部知识回答问题,不涉及外部信息。

  • 标准的检索增强语言模型(Standard retrieval augmented LMs)

    :中间部分展示标准RALM,它会检索相关文档,并用这些文档辅助回答。这种方法的缺点在于,可能受到检索到的不相关信息的干扰,影响准确性。

  • SELF-REASONING框架

    :最下面部分展示本文提出的框架。它不仅检索文档,还通过自我生成的推理轨迹(self-generated reason trajectories)来输出答案——模型会进行自我推理,包含相关性感知、证据感知选择和轨迹分析三个过程,从而提升答案的准确性和可靠性。

1、基本思想

在SELF-REASONING框架中,模型首先通过相关性感知过程(Relevance-Aware Process)判断检索到的文档是否与问题相关,并生成相关性的理由。接着,通过

证据感知选择过程(Evidence-Aware Selective Process)

,模型选择并引用相关的文档片段作为证据,同时说明为什么这些片段能支持答案。最后,在轨迹分析过程(Trajectory Analysis Process)中,模型综合所有生成的推理轨迹,给出简洁的分析和最终推断答案。

2、具体细节

1)相关性感知过程

这项工作选用DPR和Contriever作为默认检索器R,以召回与问题相关的前k个文档。面对一个问题与一组文档时,人们可以判断问题是否与文档相关。所以,首先指导模型判断检索到的文档D与问题q之间的相关性,并要求模型明确生成解释——为什么这些文档被识别为相关。输出应包含两个字段:

相关

相关理由

。注意:如果所有检索到的文档都不相关,模型应基于预训练阶段获得的内部知识提供答案。

定义由RAP生成的自我推理轨迹为τr。

2)证据感知选择过程

回答问题时,人们通常先从文档中识别关键句子,然后引用或突出显示这些关键点。引用文档的过程有助于阅读理解,并可以作为组合多个简短答案来解决不同层面的技术。虽然人类可能瞬间完成选择和引用,但LLM需要明确制定自我推理轨迹。

该工作要求LLM明确说明为什么选择的句子在回答问题时具有支持性和合理性。

定义所选句子为论文中的证据。具体来说,检索到前k个文档后,证据感知选择过程的自我推理方法如下:

首先,指导LLM选择相关文档,并自动为选定的文档选择关键句子片段。然后,要求LLM输出这些片段能够回答问题的理由。中间输出是一个列表,每个元素包含两个字段:引用内容和引用理由,如图2所示。

定义由EAP生成的自我推理轨迹为τe。

3)轨迹分析过程

最后,将前两个过程中的所有自我推理轨迹(τr和τe)整合在一起,形成推理片段链,从而提升检索增强生成的整体性能。具体做法是:要求LLM在内部分析推理轨迹,并最终输出简洁的分析和简短答案。输出包含两个字段:分析和答案。定义由TAP生成的自我推理轨迹为τa。

4)数据生成和质量控制

训练数据生成方面,对于相关性感知过程的数据生成,手动标记相关和不相关文档是标记密集型的,因此采用GPT-4生成答案作为真实标准。具体来说,指导GPT-4生成关于不相关字段的标签,并进一步输出给定文档不能回答问题的原因。

对应的prompt如下:

将给定问题和检索到的文档作为正样本连接。对于负样本,从训练集中随机选择一个不同的问题,并检索与之相关的前k个文档,然后这些文档与初始问题连接形成负样本。为避免训练数据中的顺序偏差,打乱了文档顺序。

对于EAP和TAP数据生成,手动标注每个问题的文档引用并为每个问题编写自我推理过程在实践中不可行。

因此,采用与RAP类似的过程:先指导GPT-4生成选定文档的片段,然后输出推理过程作为轨迹。构建EAP训练数据的方法与RAP相同,只是对GPT-4的指令不同。

对应的prompt如下:

3、实验效果

具体效果如下:

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc