来源:互联网 更新时间:2026-08-06 15:36
先说几个核心判断:大语言模型(LLM)固然强大,但面对企业私有数据时,往往会暴露出几个棘手的短板——数据量大、信息提取如大海捞针、检索效率上不去、模型还总是“忘”掉上下文窗口里的内容。而检索增强生成(RAG)正是为了解决这些痛点出现的:通过把外部知识库接入LLM的生成流程,让模型在回答问题时先“查资料”,再“写答案”,效果自然提升一大截。

一句话概括RAG:从海量文档中检索出相关的片段,再把这些片段塞进prompt里,喂给LLM去生成回复。听起来简单,但要做好,里面门道不少。
RAG的实施方法不算复杂:为每个文档段落建立索引,快速锁定相关段落,再把选中的段落输入到LLM(比如GPT-4)里。这么做的好处是显而易见的——既能防止信息过载,又能通过只提供相关段落来提升输出质量。
借助RAG,LLM可以访问外部知识源(比如数据库),从而利用那些不存储在模型权重里的知识。具体来说,RAG靠一个检索器来找到相关上下文,然后用这些上下文去增强LLM的知识库。
检索器可以是以下几种,具体选哪种取决于你是否需要语义检索:
那么,图数据库和向量数据库在RAG中到底怎么选?直观来看,图数据库似乎更适合:它从文本中提取实体关系,检索结果简洁明了。不过,它要求精确匹配,这又可能成为瓶颈。反观向量数据库,靠LLM编码的向量做分区和索引,能找出语义相似的向量,但有时会带回不相关的数据。有没有两全其美的办法?一种思路是把两者结合——在图数据库中用向量表示法索引解析出来的实体关系,从而实现更灵活的信息检索。这种混合模式能否真正落地,目前还在观察中。
检索之后,通常还需要加一道排序层或精细排序层,用来过滤掉那些不符合业务规则、没有针对用户个性化、或者超出响应限制的信息。
来,用一个简洁的流程总结一下RAG:
(原图位置)
说到RAG和微调的区别,可以这么看:
下面这张图直观展示了RAG的三个关键步骤:数据提取、检索、合成/响应生成。
(原图位置)
分块,就是把要检索的文档或提示切分成更小、更易管理的片段。这些片段可以用固定大小来定义,比如特定数量的字符、句子或段落。在RAG中,每个块都会被编码成嵌入向量供检索用。块越小越精,用户查询和内容之间的匹配就越准,从而提升检索的准确性和相关性。块太大则可能引入噪声,反而降低准确性。
所以问题来了:怎么选合适的块大小?块大小得足够小以保证相关性、减少噪声,又要足够大以保持上下文完整。下面列举几种常用方法(参考Pinecone的方案):
text = "..." # your text from langchain.text_splitter import CharacterTextSplitter text_splitter = CharacterTextSplitter(separator = " ", chunk_size = 256, chunk_overlap= 20) docs = text_splitter.create_documents([text])
一条经验法则:如果分出来的文本块对人类来说都意义不明,那对语言模型来说也很难有意义。所以,为语料库找到最佳块大小,是保证搜索准确性和相关性的关键。
分块完成后,下一步就是嵌入。嵌入的目的是把用户查询和文档转换成可比较的格式,方便后续检索。可以通过HuggingFace的MTEB排行榜找到最适合的嵌入模型。这里有个选择:用稠密嵌入还是稀疏嵌入?
检索方式有很多种,这里重点看标准检索、句子窗口检索和自动合并检索。每种方法都有优劣,取决于数据集、查询复杂度以及对特异性和上下文理解的平衡需求。
想法:如果同时尝试多种块大小,然后让重新排序器对结果做一次修剪,会怎样?这样做有两个目的:一是通过汇集多个结果获得更好的检索效果(假设重排器性能合理);二是对不同的检索策略做基准测试。
流程如下:
(原图位置)
根据LlamaIndex的评估,集成方法在忠实度指标上略有上升,但成对比较显示两种方法偏好度相差不大,所以集成是否真的更好还存疑。另外,集成策略也可以扩展到RAG的其他方面,比如向量搜索与关键词搜索的混合等。
RAG流水线的最后一步是生成回复。模型将检索到的信息与预训练知识综合起来,生成连贯且上下文相关的回答。这里有个细节:在构建扩展prompt(包含检索到的top-k块)时,把重要信息放在输入序列的开头或结尾,能明显提高RAG系统的效率。
本文详细梳理了RAG的基本概念、工作流程和关键领域,包括数据提取、嵌入、检索和响应生成。重点探讨了各种检索和重排技术,以及如何高效生成用户反馈。同时,文章也指出在处理长文本时,模型性能可能受影响——尤其当相关信息位于文本中部时。因此,建议把重要信息放在输入序列的开头或结尾。通过改进检索和提示创建步骤(比如加入排序阶段),性能能提升20%左右。这些洞察对理解和优化RAG的实际应用很有参考价值。
Ondo将于今日上线股票永续合约
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
区块链OTC交易所有哪几家比较正规?
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
合集38个项目筹集5.406亿美元 Figure融资2亿
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
五菱星光L六座新能源SUV上市:三版可选,中配12.28
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
macOS 28将移除Rosetta 2兼容层,Intel应用面临运行危机
潜水员戴夫丛林DLC接吻的鱼任务攻略
电视剧《白领公寓》剧情介绍
探索我的世界材质包16x32x64x 解密我的世界材质包16x32x64x的魅力与技术
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc