热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >一文讲清楚检索增强型文本生成(RAG),极其舒坦的格式

一文讲清楚检索增强型文本生成(RAG),极其舒坦的格式

来源:互联网 更新时间:2026-08-02 13:26

RAG(Retrieval-Augmented Generation)——检索增强型文本生成,可以说是当下大语言模型应用中最热门的技术范式之一。它之所以备受关注,是因为能有效弥补大模型在知识更新和事实准确性上的短板。简单说,RAG把“检索”和“生成”两条腿结合:先从一个外部知识库中捞取最相关的信息,再交给大模型生成回答。整个过程从检索的视角可以拆解成四个核心阶段:预检索、检索、后检索、生成。下面我们逐一梳理,最后再聊聊如何评估一个RAG系统的效果。

一文讲清楚检索增强型文本生成(RAG),极其舒坦的格式

  1. RAG范式

    :从检索的角度将RAG研究领域组织成四个主要阶段:预检索、检索、后检索和生成。
  2. 预检索

    :讨论了索引、查询操作和数据修改等任务,这些任务为有效的数据和查询准备奠定了基础。
  3. 检索

    :介绍了搜索和排名的策略,包括传统检索方法和利用预训练语言模型(如BERT)来提高语义理解。
  4. 后检索

    :包括重新排名和过滤,旨在优化初始检索文档的选择,以提高文本生成的质量。
  5. 生成

    :生成阶段的任务是利用检索到的信息提高生成响应的质量,包括增强和定制步骤。
  6. 评估方法

    :介绍了评估RAG系统的方法,包括对检索和生成方面的评估。

这个框架不仅能帮你理清RAG的脉络,也为后续的研究和工程落地提供了清晰的参考。从检索角度切入,能让我们更直观地理解RAG的核心机制,进而推动进一步的探索和创新。

RAG范式

RAG的核心思路其实很简单:大模型虽然能说会道,但知识是静态的,遇到最新信息或专业领域就容易“翻车”。这时候就需要一个外设知识库——检索系统先找到相关的资料,再把资料喂给大模型,让它生成更准确、更可信的回答。这就是RAG范式的精髓所在。通常,一个完整的RAG流程包含以下几个阶段:

  1. 预检索(Pre-Retrieval)

    :这个阶段是检索的起点,主要做三件事:创建索引、优化查询、修改数据。索引就像书目的目录,把外部信息组织成便于快速查找的格式;查询优化则是把用户的提问“翻译”成更匹配索引的语言;数据修改比如去掉噪音或增加元数据,让检索效率更高。
  2. 检索(Retrieval)

    :系统使用具体的检索模型,根据处理后的查询从索引中捞出相关文档。这里可以走传统路子(比如BM25算法),也可以借助BERT这类预训练模型来捕捉语义匹配,让结果更聪明。
  3. 后检索(Post-Retrieval)

    :捞出来的文档不一定都靠谱,这个阶段就是做“精加工”——先重新排个序(Re-Ranking),再过滤掉不够格的(Filtering),确保送到生成阶段的都是精华。
  4. 生成(Generation)

    :最后一步,大模型把查询和精挑细选的文档结合起来,生成最终的回答。这里面还可以分成“增强”(补充细节)和“定制”(适配具体场景或格式)两个子步骤。

RAG范式的最大优势,就是灵活地把“检索最新信息”和“强大生成能力”拧在一起,既解决了大模型的知识滞后问题,又能输出更丰富、更准确的文本。而且它还支持多跳检索——通过多轮检索和生成,不断迭代改进输出质量,这个能力在很多复杂任务中非常有用。

预检索(Pre-Retrieval)

预检索阶段,说白了就是为检索做“备战”。如果前期准备不充分,后面的检索和生成质量都会大打折扣。主要任务有三项:

  1. 索引(Indexing)

    :把外部数据源组织成可快速检索的结构。这个过程包括文本规范化(分词、词干提取、去停用词),以及把文本段落切分成句子或段落,方便更精准地定位。
  2. 查询操作(Query Manipulation)

    :对用户输入的查询进行调整,让它更匹配索引。常见手法有:查询重构(改写提问,更贴近用户真实意图)、查询扩展(加入同义词或相关术语,扩大召回范围)、查询规范化(统一拼写或术语差异,保证匹配一致性)。
  3. 数据修改(Data Modification)

    :通过预处理提升检索效率,比如去掉冗余或不相关信息,或者添加元数据来丰富数据维度,从而提高检索内容的相关性和多样性。

预检索阶段的优化直接决定了后续检索系统的性能天花板。把数据和查询准备得越精细,后面检索到的信息就越相关、越准确,最终生成的文本质量自然也就更高。

检索(Retrieval)

检索阶段是整个RAG流程的心脏,它负责根据处理后的查询,从预建好的索引中找出最相关的文档。具体包括以下几个关键环节:

  1. 搜索与排名(Search & Ranking)

    :搜索算法在索引中遍历,找到所有可能匹配的文档,然后根据相关性给它们排个队。
  2. 检索策略

    :可以采用传统算法(比如BM25),也可以借助预训练语言模型(如BERT)来理解查询的语义。后者不再只看关键词匹配,而是真正理解词在上下文中的含义。
  3. 语义理解

    :这是现代检索的核心能力——系统能根据词汇的上下文含义来评估文档相关性,而不是单纯靠关键词频率。
  4. 向量距离测量

    :很多现代系统会计算文档向量和查询向量之间的距离,把传统指标和语义理解结合起来,产出既相关又符合用户意图的结果。
  5. 多跳检索(Multi-hop Retrieval)

    :一些高级系统会采用多轮检索,逐步迭代,不断逼近更精确的答案。

检索阶段的效率和准确性,直接影响后续生成文本的质量。捞回来的文档越精准,大模型生成的回答就越靠谱。

后检索(Post-Retrieval)

检索阶段捞上来的文档往往鱼龙混杂,有的相关度高,有的只是沾边。后检索阶段的作用就是“淘金”——把真正有价值的文档挑出来,给生成阶段提供最优质的输入。主要包括两个步骤:

  1. 重新排名(Re-Ranking)

    :对初排结果进行二次打分,更精准地突出与查询最相关的文档,同时降低不相关文档的权重。因为此时候选集已经很小了,可以用一些精度高但速度慢的预训练模型来做重排。
  2. 过滤(Filtering)

    :设定一个相关度门槛,比如最小得分阈值,把低于该值的文档直接扔掉。过滤时还可以参考用户反馈或历史相关性评估,动态调整策略。

后检索阶段像是一座桥梁,连接检索和生成。它确保大模型接收到的信息是经过精炼的、高度相关的,从而大幅降低生成阶段出错或跑偏的概率。

生成(Generation)

生成阶段是RAG流程的最后一环,也是直接面向用户的一环。它把用户查询和检索到的文档融合在一起,产出连贯、相关且满足需求的文本。具体步骤包括:

  1. 增强(Enhancing)

    :将检索到的信息与查询合并,丰富回答的内容细节。生成文本既要保持与检索内容一致,也要有创造性地引入新见解。
  2. 定制(Customization)

    :根据用户偏好或场景需求调整内容,比如适配目标受众、精简信息、生成摘要或提要,强调核心论点。
  3. 生成文本

    :把查询和检索信息拼接后输入大语言模型,由模型生成最终输出。
  4. 质量控制

    :检查生成的文本是否准确、相关,有没有误导性信息。
  5. 后处理

    :包括校对、编辑、格式调整,确保最终的输出符合质量要求和风格规范。

生成阶段直接决定用户体验。它不仅要把检索到的信息准确传递出来,还要以一种有用、可接受的方式呈现。对话生成、摘要、问答等各种任务都可以基于这个流程来定制。

评估(Evaluation)

一个RAG系统好不好,不能光凭感觉。需要从多个维度来量化和定性评估,下面是一些主流的评估方法:

  1. 检索基础方面(Retrieval-based Aspect)

    • Accuracy

      :衡量检索文档提供正确信息的精确度。
    • Rejection Rate

      :系统在找不到相关信息时拒绝回答的能力。
    • Error Detection Rate

      :模型识别并忽略检索文档中错误或误导信息的能力。
    • Context Relevance

      :检索文档与查询的相关性。
  2. 生成基础方面(Generation-based Aspect)

    • BLEU

      :衡量生成文本的流畅性和与人类文本的相似度。
    • ROUGE-L

      :量化文本与参考摘要的重叠,评估捕获主要思想的能力。
    • Exact Match (EM)

      F1 Score

      :分别衡量完全正确答案的比例和精确率/召回率的平衡。
  3. 多维度评估框架

    • RAGAS

      :评估生成文本质量、检索文档相关性以及生成内容的忠实度。
    • ARES

      :在RAGAS基础上增加了置信区间和对排名准确性的评估。
    • RECALL

      :评估模型对外部反事实知识的鲁棒性,包括响应质量和错误检测率。
    • RGB

      :评估RAG对LLMs的影响,包括噪声鲁棒性和信息整合的准确性。
  4. 特定能力评估

    :比如在对话生成、问答等具体任务上的表现。
  5. 抗误导性评估

    :系统避免生成误导信息的能力。
  6. 鲁棒性评估

    :系统对不准确信息的鲁棒性。
  7. 任务特定评估

    :使用任务相关指标来评价性能。
  8. 用户反馈和先前评估

    :利用用户反馈或历史评估结果来调整过滤策略。

这些评估方法覆盖了检索和生成两个维度的性能,也考虑了鲁棒性、抗误导性等更全面的指标。通过多维度评估,开发人员可以更清楚地了解RAG系统的优势与短板,从而有针对性地优化模型、改进流程。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc