来源:互联网 更新时间:2026-08-27 14:04
最近,RAG(检索增强生成)在日常工作中间出现的频率越来越高,网上相关的资料也是铺天盖地。今天这篇文章,咱们就把RAG从头到尾捋一遍——它到底是什么、怎么工作的、有哪些优化手段、怎么评估它的效果,以及目前还面临哪些坑。不求讲得多深,但求把脉络理清楚。
大型语言模型(LLM)已经渗透到我们生活和工作的方方面面,它们用惊人的灵活性和智能改变了人和信息打交道的模式。不过,别看它们神通广大,毛病也不少:动不动就“幻觉”,给你编出一套看起来挺像那么回事的假东西;信息源可能早就过时了;遇到专业领域的问题,深度不够;推理能力也经常掉链子。
在实际落地的时候,数据得不断更新才能跟上最新动态,生成的内容还要透明、可追溯,同时还得控制成本、保护数据隐私。光靠一个“黑盒子”模型显然不够用——我们需要更精细的方案来搞定这些复杂需求。正是在这个节骨眼上,检索增强生成(RAG)作为AI领域的一个突破性方向,开始受到广泛关注。
图中是RAG在问答中的典型应用(向ChatGPT询问OpenAI首席执行官Sam Altman的解雇和重新聘用事宜)
RAG的思路很直接:在语言模型生成答案之前,先从外部文档数据库里检索相关信息,有了这些“外设”知识再作答。这样一来,内容的准确性和针对性就上了一个台阶。
RAG这个概念最早是Lewis在2020年提出的,这些年发展得特别快。最开始的研究重点放在“预训练阶段”,想通过往语言模型里注入额外知识来增强它的能力。ChatGPT的火爆则点燃了大家对利用大模型做深层上下文理解的兴趣,也加速了RAG在推理阶段的发展。随着研究者们把大模型的能力越挖越深,焦点慢慢转向了增强可控性和推理技能。GPT-4的出现算是一个重要的里程碑——它用一种新思路重新定义了RAG,把检索增强和微调技术结合了起来,同时继续优化预训练策略。
RAG研究的时间轴树
从技术范式的角度来看,RAG的演变大致可以分为以下几个阶段:
经典的RAG过程,也叫Naive RAG(朴素RAG),主要包括三个基本步骤:
用向量相似度搜索,把最相关的k个文档片段找出来。
把原始查询和检索到的文本拼在一起,喂给LLM,得出最终答案。
Naive RAG在检索、生成和增强这几个环节都面临不少问题。于是高级RAG范式就出来了,它在检索前和检索后都加了额外的处理。检索之前,可以用查询重写、路由、扩展等方法,对齐问题和文档块之间的语义差异。检索之后,对拿到的文档做重排,可以避免“中间内容丢失”的现象;或者对上下文进行过滤和压缩,缩短窗口长度。
随着技术继续演进,出现了突破传统Naive RAG“检索-生成”框架的新思路,也就是模块化RAG(Modular RAG)。它的结构更加自由灵活,引入了更多专门的功能模块,比如查询搜索引擎、多种答案的融合等。技术上,它把检索和微调、强化学习等技术整合在一起。流程方面,RAG模块被设计和编排,催生了各种不同的RAG模式。
不过,模块化RAG并不是突然冒出来的。三种范式之间是继承和发展的关系:
要搭一个靠谱的RAG系统,增强部分是关键,需要想清楚三个核心问题:
Token、分片、段落、实体、知识图谱等
1、在推理过程中做一次性检索:检索效率高,但文档相关性可能偏低;2、平衡效率和信息,但未必是最优解;自适应地去搜索;3、每生成N个令牌检索一次,信息量大,但效率低,信息容易冗余。
在推理过程中,把检索到的信息集成到生成模型的不同层。1、输入数据层:使用简单,但没法支持检索更多的知识块,优化空间有限;2、模型中间层:能支持更多知识块,但引入了额外的复杂性,必须经过训练;3、输出预测层:保证输出结果和检索内容高度相关,但效率低一些。
从这三个问题出发,可以把增强方式整理如下:
Small-2-Big:句子级别的嵌入,扩展了生成过程中的窗口。
Slidingwindow:覆盖整个文本,避免语义歧义。
摘要:先通过摘要检索文档,再从文档里检索文本块。
伪元数据生成:通过为输入的查询生成假设文档,以及创建文本块可以回答的问题,来增强检索效果。
检索语料库的层次组织

根据特定领域库和下游任务进行微调
微调适配器模块,让Embedding模型和检索数据库对齐
从语料库里迭代检索,获得更详细、更深入的知识。
由LLM动态决定检索的时间和范围。
除了RAG,LLM的主要优化策略还有提示工程(Prompt Engineering)和微调(Fine-tuning)。它们各有各的用武之地。看具体场景——对外部知识的依赖程度、对模型调整的要求不同,适合的方案也不一样。
可以这么理解:RAG就像是给了模型一本定制信息检索的教科书,特别适合处理特定的查询;而微调则像学生通过时间内化知识,更适合模仿特定的结构、风格或格式。微调能增强基础模型的知识、调整输出、教授复杂指令,从而提升模型的性能和效率。但它不擅长整合新知识,也不适合快速迭代新场景。
RAG的评估方法挺多的,主要围绕三个质量分数:
在评估框架方面,有RGB、RECALL这样的基准,还有RAGAS、ARES、TruLens等自动化评估工具,它们能帮助我们全面衡量RAG模型的性能。
目前RAG面临的主要挑战包括:
RAG的应用已经不局限于问答系统了,它的影响力正在向更多领域扩展。推荐系统、信息提取、报告生成等任务都开始受益于RAG技术。
与此同时,RAG还催生出了LangChain、LlamaIndex这类知名工具。
腾讯ima怎么把微信内容一键导入知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
腾讯ima怎么创建共享知识库?
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
WorkBuddy微信版怎么获得积分?
5000元起的鼠标哪个最值得入手?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
车载冰箱重置到出厂设置几步?
SPX6900(SPX)币是什么?SPX币价格走势分析及未来展望
腾讯ima知识库怎么分类管理?
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
博世壁挂炉关闭暖气怎么操作
男生高性价比充电头?
管线机怎么接云米净水器
kimi提示词专家使用方法新手指南
5000-6000元鼠标有什么推荐?
WorkBuddy积分怎么获得?
Windy卫星云图怎么看?云层变化识别技巧
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc