来源:互联网 更新时间:2026-08-25 13:48
RAG技术通过检索外部知识库,再结合大语言模型,确实给复杂的问答、文本摘要和内容生成这类任务带来了全新的解题思路。不过,技术落地从来不是一帆风顺的。尽管RAG优势明显,但在实际应用中,它也碰上了几个绕不开的硬骨头:
检索技术的天花板:说白了,RAG的检索能力上限,依然受限于我们传统的基于词汇和向量的搜索技术本身。它跑得再快,也跳不出搜索框架的掌心。
人类的表达效率问题:现实是,大多数人并不擅长把自己真正想搜的东西准确表述出来。打错字、表达含糊、翻来覆去就那么几个词——这些都是家常便饭。结果就是,大量隐藏在表层结果之下的高质量信息,就这样被错过了。RAG虽然能帮忙,但治标不治本。
搜索被过度简化了:我们现在习惯的搜索范式,就是把用户的查询直接线性映射到一个答案上。但人类的需求是立体的、多维的,这种线性的思维模型,根本无法捕捉复杂查询背后的细微差别和上下文,结果的相关性自然会打折扣。
为了解决这些问题,业界提出了各种优化策略。今天想分享一个思路,成本很低,但效果出乎意料得好——RAG-Fusion。
RAG-Fusion的出现,正是为了突破RAG原有的局限。它的核心思路很简单:不再只依赖于用户那一个粗糙的查询,而是先生成多个角度的用户查询,再把搜索回来的结果进行重新排序。这背后依赖的是逆向排名融合(RRF)和自定义的向量评分加权,最终实现更综合、更准确的搜索。它的目标,是弥合“用户明确问的”和“用户真正想知道的”之间的那道鸿沟,去发掘那些隐藏的、有变革意义的知识。
整体流程如下图所示,大致可以分为五个步骤:

为什么要费劲生成多个查询?
在传统搜索里,用户输入一个查询,系统就根据这个查询去找。简单直接,但局限也大。一个单一的查询,很可能无法囊括用户关心的所有方面,或者它本身定义得过于狭窄,根本找不到全面的结果。这时候,从不同角度生成多个查询就显得非常必要了。
通常的做法是借助LLM,对用户最初的Query进行拆解和变形。这些生成的新查询可不是随机乱改,而是精心设计,旨在提供原始问题的不同视角。举个例子,如果用户搜的是“气候变化的影响”,那么LLM生成的查询可能就包括“气候变化的经济后果”、“气候变化与公共健康”等等。这种思路确保了搜索过程能覆盖更广阔的信息面,最终的输出在质量和深度上自然会好很多。
逆向排名融合(RRF)这项技术,是由滑铁卢大学和谷歌联合开发的,专门用来把多个搜索结果列表融合成一个更优的整体排名。它的表现据说比任何一个单独的系统都要好,也超越了普通的重新排名方法。
它的原理是通过汇总不同搜索请求中的排名,来提高最相关文档在最终结果列表顶部出现的概率。最妙的地方在于,RRF不依赖搜索引擎给出的具体分数,只看每个文档的相对排名。这意味着它能很好地融合来自不同系统、评分尺度可能完全不一样的搜索结果。
以前,RRF常被用来混合词汇搜索和向量搜索的结果。这确实能弥补向量搜索在查找特定术语(比如缩写)时的短板。但有时候,融合出的结果看起来像是把几个结果集硬拼在一起,因为用词汇和向量对同一个查询进行搜索,很少会得到完全相同的结果。
简单来说,你可以把RRF想象成一位决策者,他在做决定前得把所有人的意见都听一遍。只不过在这里,扮演“听众”角色不仅不烦人,反而能帮我们筛选出更准确的结果。就像从多视角中寻找最佳答案一样,观点越多,最后的结论就越精确。

最后一步,把重新排名后的文档和所有生成的多路查询,一起输入到LLM的提示词里,让它按照典型的RAG方式(比如生成回复或摘要)来生成最终输出。在实际使用中,一个潜在的挑战是,生成的多个查询可能会稀释用户最初的意图。为了缓解这个问题,我们通常在prompt里特别强调,要求LLM更重视原始查询。
在实际使用中,RAG-Fusion的优势确实很明显,可以总结为以下几点:
源材料质量更高:用上RAG Fusion,搜索深度绝不仅仅是“增强”,而是被放大了。重新排名的文档列表,让你不是在信息表面刮一刮,而是真正潜入观点的海洋里。这种结构化的输出本身就很好读,直观上就让人觉得可信,这在今天这个对AI生成内容普遍持怀疑态度的世界里,是个极其宝贵的品质。
增强用户意图理解:RAG Fusion的核心设计,就像一个善解人意的人工智能,努力去揭示用户想表达但又说不清楚的东西。多查询策略捕捉了用户信息需求的多面性,所以最终的输出非常全面,能真正与用户的深层意图产生共鸣。
结构化且富有洞见的输出:通过汲取多样化的信息源,模型能制作出结构良好且富有洞见的答案,甚至能预判并主动解答用户接下来可能问的问题。
自动纠正用户查询:这个系统不仅能解释查询,还能优化查询。通过生成多个查询变体,RAG Fusion在无形中完成了拼写和语法检查,从而提高了搜索结果的准确性。
处理复杂查询:人类在表达复杂或专业的想法时,语言上常常会遇到障碍。RAG Fusion就像一种语言催化剂,生成的查询变体可能自动包含了用户本应使用但没有用上的专业术语,从而获得更集中、更相关的搜索结果。它还能把又长又复杂的查询,拆解成向量搜索能处理的更小、更易管理的小块。
搜索中的意外发现:想想那些“未知的未知”——你直到遇到它,才知道自己需要它。通过采用更广泛的查询范围,系统促成了发现意外信息的可能性。这些信息虽然不是用户明确在找的,但对用户来说却可能是一个“欧雷卡”时刻。这一点,让RAG Fusion明显区别于其他传统的搜索模型。
然而,任何技术都有它的两面性,RAG以及它的各种优化策略,也有自己特定的局限和挑战。RAG-Fusion同样如此:
过于冗长的风险:RAG-Fusion的深度,有时候会导致信息泛滥。输出可能过于详细,让人感觉不堪重负。
平衡上下文窗口的难题:多查询输入和多样化的文档集,会挤占语言模型的上下文窗口。对于上下文限制比较严的模型来说,这可能导致输出不连贯,甚至被截断。
在使用RAG-Fusion时,需要特别警惕一点:LLM生成的查询有时可能会偏离原始用户意图。所以我们必须认真思考,我们要把多少控制权让渡给AI,以及相应的代价是什么。尽管我们在prompt中已经优先考虑了原始用户查询,确保其重要性,但有时模型能力不够强,对指令的遵循度就会差一些。为了解决这个问题,我们在实际的产品UI上做了一些调整:
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
短剧《史上最强洪荒修为》剧情介绍
海尔消毒柜自动消毒如何中止
5000元起的鼠标哪个最值得入手?
男生高性价比充电头?
博世壁挂炉关闭暖气怎么操作
腾讯ima知识库怎么分类管理?
车载冰箱重置到出厂设置几步?
Windy卫星云图怎么看?云层变化识别技巧
5000-6000元鼠标有什么推荐?
管线机怎么接云米净水器
笔记本移动电源推荐哪款?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc