来源:互联网 更新时间:2026-08-25 14:00
发布时间:2024 年 08 月 16 日
RAG
Meta Knowledge for Retrieval Augmented Large Language Models
RAG 技术通过增强 LLM 的上下文相关信息,提升了其处理时效性和领域特定问题的能力,但构建高效综合多样化文档信息的 RAG 系统仍具挑战。我们创新性地将传统“检索-阅读”流程升级为“准备-重写-检索-阅读”框架,通过生成元数据和合成问答,以及引入元知识摘要,实现了对知识库的专家级理解。研究显示,增强查询在性能上显著超越传统 RAG 方法,且元知识查询进一步提升了检索和答案质量。该方法成本低廉,适应性强,为 RAG 流程的性能提升开辟了新路径。
https://arxiv.org/pdf/2408.09017

检索增强生成(RAG)早已成为大语言模型应用中的标配技术——它通过整合与上下文紧密相关、时效性强或具备领域深度的知识,在无需调整模型权重的前提下,生成用户期望的正确答案。RAG在知识密集型任务(比如领域问答、实时数据查询)中尤其出彩,也成了缓解模型幻觉的利器。
但在实际部署中,RAG并非银弹。下面几个问题经常让人头疼:
知识库文档本身可能含有大量噪声——不仅有内容层面的干扰,更因为文档来源五花八门(PDF、PPT、Word等格式混搭),缺乏标准化。
大多数场景下,文档分块、嵌入和检索环节几乎没有人工标注的相关性标签,导致整个检索过程像是个无监督的“盲盒”,难以针对特定用户做个性化处理。
长文档分块后,语义上下文被割裂,而且分块越大,保留的上下文精度越差。这意味着分块策略的选择直接影响后续步骤质量,却往往只能凭经验试错。
用户查询通常短小、模糊,可能存在词汇不匹配,或者复杂到需要多篇文档才能回答。准确捕捉用户意图、找到最匹配的文档,常常成了难题。
更棘手的是,关键信息可能分散在多个文档中,跨文档的高级推理目前仍缺乏有效解法。
这篇论文将焦点锁定在“需要跨文档进行高级推理”的场景(例如:“将机器学习应用于营销有哪些挑战?”)。
为此,作者提出了一套全新的数据驱动工作流,命名为“准备-重写-检索-阅读”(PR3)。核心思路是:让大模型先对每篇文档做深度处理,生成

如上图所示,新框架引入“基于元数据的问答集群”和“元知识摘要”,将用户的初始查询扩展为多个定向查询,从而提升搜索的特异性、广度和深度。
这套方法融合了两条技术路线:一是从文档集合生成问答并用于LLM微调;二是借助查询增强提升RAG管道中检索器的性能。
基于微调改进RAG的方式,需要精心清理数据、人工管理,还得在超参数上反复试错,才能让模型适应任务而不遗忘预训练知识。如果知识库频繁更新,模型调整难以为继,而且对计算资源的需求通常不低——尽管参数高效微调(PEFT)技术已经降低了门槛。
在电商场景中,淘宝曾基于公司日志和拒绝采样构建查询重写框架,用有监督方式微调大模型(不生成问答),并引入对比学习校准查询生成概率,最终大幅提升了商品数量、交易量和独立访客数。
另一种方案是借助黑箱大模型的评估结果,用强化学习训练较小的查询重写大模型,在开放域和多项选择题问答中取得了持续提升。不过强化学习方法训练过程不稳定,且需要仔细权衡泛化与专业化。
近期还出现了其他端到端优化思路,比如RAFT专门训练阅读器区分相关/无关文档,而QUILL用RAG增强的蒸馏方法训练另一个大模型来完全替代RAG管道。
作为微调的替代方案,查询增强方法通过转换用户查询来提升检索性能,分为两类:
利用文档检索传递信息
零样本(不依赖任何示例文档)
在零样本路径上,HyDE提出了一种数据增强方式:让大模型为用户查询生成假设的响应文档,拉近查询与目标文档在嵌入空间的距离,从而提升检索质量。实验表明,它在多种任务上与微调后的检索器性能相当。但生成的文档本质上只是简单的数据增强,
无论是微调还是零样本增强,传统RAG管道中的检索器通常对目标文档集合的分布缺乏感知。新框架的做法是:在推理之前,对每篇文档创建一组定制的元数据,然后用Claude 3 Haiku的思维链(CoT)提示生成跨文档的引导式问答。
对于任意与用户相关的元数据组合,再借助Claude 3 Sonnet生成一个“元知识摘要”(Meta Knowledge Summary,简称MK摘要),汇总给定过滤器下数据库中的关键概念。推理时,根据用户感兴趣的元数据,用个性化的MK摘要动态扩充用户查询,从而输出量身定制的答案。这样一来,检索器就获得了跨文档推理的能力——否则需要多次检索和推理轮次才能实现。
通过定制化搜索和元知识信息的复杂推理,最终在深度、覆盖范围和相关性等多个维度上提升了端到端检索管道的质量。而且,新方法不依赖任何模型权重更新,还能与基于微调的优化手段无缝结合,进一步拉高RAG管道的性能上限。
公共基准用例采用通过arXiv API整理的2024年2000篇研究论文,涵盖统计学、机器学习、人工智能和计量经济学等多个领域。
首先,对每篇文档使用CoT提示生成一组元数据,并基于这些元数据生成后续的问答对(如下图所示)。


提示的作用是将文档归入预定义的类别集合(例如论文数据集中的研究领域或应用类型),从而创建元数据列表。接着,通过师生提示(teacher-student prompting)生成一组合成问题和答案,以评估学生对文档知识的掌握情况。生成的元数据既充当增强搜索的过滤参数,也会以元知识信息(MK摘要)的形式用于用户查询的扩展。此外,合成问答(示例如下)会被用于检索——不过只有问题被向量化处理,以备下游检索使用。
-- Question #1: "What are the researchers’ conjectures about why the future narrative prompting approach seemed to unlock improved predictive capabilities in ChatGPT-4 compared to direct prompting?"
-- Answer #1: "The researchers conjecture that the narrative prompting approach may leverage ChatGPT-4’s capacity for "hallucinatory" narrative construction, allowing it to more effectively synthesize and extrapolate from its training data to make more accurate predictions, compared to the direct prompting approach. This suggests the models’ creative abilities can be strategically utilized for predictive tasks."
-- Question #2: "How does the distribution of preference datasets influence the rate of model updates and the training accuracy when using the Direct Preference Optimization (DPO) objective? What are the implications forpractical alignment approaches?"
-- Answer #2: "The paper provides theoretical analysis showing that the distribution of preference datasets, characterized by "preference distinguishability", has a strong influence on the rate of model updates and training accuracy under the DPO objective. Beha viors with higher distinguishability exhibit faster loss reduction and parameter updates. This can lead to an intricate prioritization effect, where DPO tends to prioritize learning beha viors with higher distinguishability, potentially deprioritizing less distinguishable but crucial beha viors."
为了分析生成问答的冗余性,研究团队使用e5-mistral-7b-instruct在问题的嵌入空间上进行层次聚类。但由于问答对的重叠率较低,最终并未对合成问答做去重处理。
对于给定的元数据组合,生成一个元知识摘要(MK摘要),用于后续查询的数据增强阶段。以论文场景为例,元数据限定在文档处理阶段由Claude 3 Haiku识别的特定研究领域,比如强化学习、监督/非监督学习、贝叶斯方法、计量经济学等。
针对特定的元数据组合,构建元知识摘要(MK Summary),用于特定用户查询的数据增强阶段。在论文案例中,元数据仍限定于Claude 3 Haiku识别的特定研究领域。利用Claude 3 Sonnet对带有相关元数据标签的一系列问题进行概念性总结,从而生成MK摘要。未来一个潜在方向是调整提示词,优化摘要的适配度。
在没有相关性标签的情况下,将Claude 3 Sonnet作为可信评估者,对比以下四种基准方法:
Naïve Search with Chunking:无查询增强的传统分块检索
Augmented Search with Chunking:带朴素查询增强的传统文档分块
Augmented QA Search:使用PR3管道但不包含MK摘要的增强搜索
MK-Augmented QA Search:使用PR3管道并包含MK摘要的增强搜索
评估指标包括六项:

针对每个合成的用户查询,比较四种方法检索到的上下文及其最终答案。使用Claude 3 Sonnet对每项指标打分(0-100分),并附上理由。将所有查询的指标结果取平均,如下图所示。

结论很清晰:新框架在所有指标上都有显著提升,唯一的例外是两种基于问答的方法(Augmented QA Search和MK-Augmented QA Search)在检索精度上没有明显改善——这说明返回的文档几乎没有完全不相关的。广度和深度两项指标提升尤为突出,表明MK摘要提供了额外信息,并在查询增强步骤中被有效利用。MK摘要对搜索条件的贡献在所有指标上均具有统计学显著性(检索器的精度指标除外,Augmented QA Search与MK-Augmented QA Search之间的p值<0.01)。新框架将搜索广度提升了20%以上(与传统的朴素搜索相比),这一结果与直觉一致:系统更有效地综合了数据库内容,并更广泛地利用了这些信息。
这篇论文提出了一种全新的数据驱动RAG工作流,用合成问答生成取代传统的文档分块框架,并借助基于文档内容元数据聚类的高级摘要进行查询增强,从而提升端到端LLM增强管道的精准度与质量。实验表明,该方法明显优于依赖文档分块和简单查询增强的传统RAG管道。
新引入的“元知识摘要”(MK摘要)概念,推动了知识库中的零样本搜索增强,在测试案例中全面提升了端到端RAG管道的性能。本质上看,这套方法改进了文档编码向量空间中的简单语义匹配,能够进行更多样化但高度相关的文档搜索,进而为用户提供更全面、更专业、综合性更强的答案。
在召回率、精度、特异性、广度、深度和相关性这六项核心指标上,新提出的方法均超越了现有最优水平。
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
5000元起的鼠标哪个最值得入手?
男生高性价比充电头?
博世壁挂炉关闭暖气怎么操作
腾讯ima知识库怎么分类管理?
车载冰箱重置到出厂设置几步?
Windy卫星云图怎么看?云层变化识别技巧
5000-6000元鼠标有什么推荐?
管线机怎么接云米净水器
笔记本移动电源推荐哪款?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc