来源:互联网 更新时间:2026-08-22 14:40
今天是2024年8月9日,星期五,北京,天气晴。

今天这篇文章主要聊两个话题。一个是回顾一下昨天的大模型进展,另一个是梳理现有文档处理方面的工具合集——最近风向很明显,类似同质化的工具越来越多。
比如,有个叫
仔细看,它的优点在于兼容了更多格式,针对不同格式集成了不同处理组件;缺点也很明显:Office文档处理组件基于开源封装(比如Langchain),而PDF页面内容解析完全依赖多模态模型,既费token又慢,效果完全看模型能力,而且没有考虑文档的细粒度布局信息。
话说回来,现在这些工具几乎同质化得厉害,总结下来无非几条路:
另外,再来看一下百度的RAG策略——SELF-REASONING框架,跟Self-RAG的思路很像,值得参考。
SELF-REASONING框架源自论文
Figure2在文章中给出了一个直观的比较,展示了SELF-REASONING框架如何改善检索增强型语言模型(RALMs)。图示分为三个部分,每种对应一种回答问题的方式:
在SELF-REASONING框架中,模型首先通过相关性感知过程(Relevance-Aware Process)判断检索到的文档是否与问题相关,并生成相关性的理由。接着,通过
这项工作选用DPR和Contriever作为默认检索器R,以召回与问题相关的前k个文档。面对一个问题与一组文档时,人们可以判断问题是否与文档相关。所以,首先指导模型判断检索到的文档D与问题q之间的相关性,并要求模型明确生成解释——为什么这些文档被识别为相关。输出应包含两个字段:
定义由RAP生成的自我推理轨迹为τr。
回答问题时,人们通常先从文档中识别关键句子,然后引用或突出显示这些关键点。引用文档的过程有助于阅读理解,并可以作为组合多个简短答案来解决不同层面的技术。虽然人类可能瞬间完成选择和引用,但LLM需要明确制定自我推理轨迹。
首先,指导LLM选择相关文档,并自动为选定的文档选择关键句子片段。然后,要求LLM输出这些片段能够回答问题的理由。中间输出是一个列表,每个元素包含两个字段:引用内容和引用理由,如图2所示。
定义由EAP生成的自我推理轨迹为τe。
最后,将前两个过程中的所有自我推理轨迹(τr和τe)整合在一起,形成推理片段链,从而提升检索增强生成的整体性能。具体做法是:要求LLM在内部分析推理轨迹,并最终输出简洁的分析和简短答案。输出包含两个字段:分析和答案。定义由TAP生成的自我推理轨迹为τa。
训练数据生成方面,对于相关性感知过程的数据生成,手动标记相关和不相关文档是标记密集型的,因此采用GPT-4生成答案作为真实标准。具体来说,指导GPT-4生成关于不相关字段的标签,并进一步输出给定文档不能回答问题的原因。
对应的prompt如下:
将给定问题和检索到的文档作为正样本连接。对于负样本,从训练集中随机选择一个不同的问题,并检索与之相关的前k个文档,然后这些文档与初始问题连接形成负样本。为避免训练数据中的顺序偏差,打乱了文档顺序。
对应的prompt如下:
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
WorkBuddy微信版怎么获得积分?
车载冰箱重置到出厂设置几步?
5000元起的鼠标哪个最值得入手?
比特币 2025 年价格预测:BTC 的未来走势
笔记本移动电源推荐哪款?
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
Aptos(APT)2026-2032年价格预测与历史走势梳理
短剧《仙人跳获透视,古玩玉器我全拿捏》剧情介绍
腾讯ima知识库怎么分类管理?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc