热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >缺乏元数据的混合检索器

缺乏元数据的混合检索器

来源:互联网 更新时间:2026-08-02 12:47

Blended RAG:IBM新研究,大幅超越传统RAG的新方案

RAG

缺乏元数据的混合检索器

检索增强生成(RAG)已经成为搭起大模型和私有文档库最常用的基座。不过,当文档库规模膨胀到一定程度,RAG的准确率开始出现肉眼可见的瓶颈。问题出在哪儿?关键在于那个负责从海量文档里捞取相关信息的组件——检索器,它很大程度上决定了最终回答质量的下限。这篇来自IBM的新研究,提出了一种混合RAG策略,融合了密集向量索引、稀疏编码器索引、语义搜索和混合查询等多种手段。在NQ等数据集上刷新了基准记录,在SQUAD这类生成式问答任务上也显著超越了传统的微调方法。

RAG的局限性

要说RAG为什么能火,核心其实就一句话:把大模型超强的推理能力和外部知识库结合起来。说白了,就是在模型“想”的基础上,再给它一个“查”的能力。这个框架通常分成两个模块:检索器(R)和生成器(G)。生成器的表现,主要取决于大模型本身的参数规模和效果。

但问题也很明显——大模型输出再流畅,知识库如果给不到点上,一切免谈。这时候,检索器的角色就变得至关重要。它得在极短的时间内,从海量文档里筛出最相关的信息,为模型补全上下文。目前主流的检索方法,大多还是盯着关键词或者向量相似度来匹配。可这种方式往往只能对上“字面意思”,但用户的“真实意图”可能差了十万八千里。就算你费劲调Prompt、调参数,如果检索器捞上来的东西跟问题根本不搭,最终答案也很难靠谱。

所以,要想从根本上提升RAG的准确率,优化检索器这一环其实更有空间、也更有价值。这篇文章的核心思路,就是通过语义搜索和混合查询,来提高检索器的水准,进而带动整个系统的表现。

什么是 Blended RAG?

论文尝试了三种搜索方式:基于关键词的相似度搜索、基于密集向量的搜索、基于语义的稀疏编码器搜索。最关键的一步,是把这三者融合起来,搞出一种混合型查询。语义搜索的进步在于,它不是简单匹配字面含义,而是试图理解用户究竟想问什么。这项研究系统性地评估了三种主要索引对应技术的表现:

  • BM25负责关键词搜索
  • KNN负责向量搜索
  • Elastic Learned Sparse Encoder(ELSER)则负责稀疏编码器的语义搜索

具体来说,BM25索引擅长全文搜索和模糊匹配,为高级查询打下基础;密集向量索引依靠句子转换器,衡量文档和查询向量表示的相似度;稀疏编码器索引则将语义理解与相似性检索结合,捕捉词汇之间微妙的关系,更真实反映用户意图与文档的相关性。

评估方法

评估分为几个步骤。先从BM25索引的基本匹配查询入手,再转向混合查询,融合多个字段的不同搜索技术,并利用稀疏编码器基础索引进行多次匹配。这种方法的优势在于,当文档中查询文本的确切位置不确定时,能确保检索结果的全面性。多匹配查询主要有几种模式:

  • 跨界字段

    :在多个字段间寻找交集
  • 多领域

    :透过各个领域的不同视角捕捉文本表现
  • 精选字段

    :聚焦单一字段内词汇的聚合
  • 短语优先

    :与精选字段类似,但更侧重短语匹配

初步匹配完成后,引入了密集向量(KNN)和稀疏编码器索引,并为各自设计了专门的混合查询。这样做的好处是,可以汇聚各个索引的长处,共同提升检索精确度。通过计算前k项检索准确度指标,来提炼每种查询方式的核心价值。在众多组合中,最终筛选出六种表现最好的混合查询,并在NQ、SQUAD、HotPotQA等基准数据集上进行了严格测试。

检索器(Retriever)测试结果

NQ数据集的结果

针对NQ数据集,结合稀疏编码器和最佳字段的混合查询实现了最高的检索准确率,达到了惊人的88.77%。这个成绩不仅是所有方法中最优的,也为该数据集内的检索任务创造了新的参考标准。

HotPotQA数据集中的前10项检索精准度

HotPotQA数据集包含超过500万文档和7500个查询,计算量相当大,全面评估很难。从结果来看,采用跨领域和精选领域等策略的混合查询表现尤为突出。

HotPotQA结果图

其中,融合了稀疏编码器与精选领域搜索的混合查询在效率上达到了65.70%,是表现最好的组合。

测试结果总结

有几个值得注意的发现:

  • 除了CoQA数据集之外,混合查询在所有数据集上都显示出检索准确率的提升,这得益于它有效利用了元数据来获取更贴切的搜索结果。
  • 采用基于密集向量的(KNN)语义搜索技术,相比传统的关键词搜索方法,进步是显著的。
  • 基于语义搜索的混合查询在检索精度上,普遍超越了传统的关键词搜索和纯向量搜索。
  • 当结合“最佳字段”策略使用稀疏编码器的语义搜索时,往往能交出最亮眼的成绩。

RAG评估测试结果

确定了最佳检索器组合之后,接下来需要验证它在完整RAG流程中的表现。为了排除大模型规模或类型的影响,所有实验统一采用FLAN-T5-XXL模型进行。

针对SqUAD数据集的V-ARAG评估

SqUAD是评估生成式问答的经典数据集。研究对比了三种RAG流程变体:

  • RAG-original

    :是在自然问题数据集上微调过的模型,尚未进行特定领域适配。
  • RAG-end2end

    :作为进阶版,该模型针对SQuAD领域进行了进一步的微调,以实现领域适配。
  • Blended RAG

    :我们的方案独树一帜——没有在SQuAD数据集或相关语料库上进行任何训练。它结合了优化的字段选择和语义索引的混合查询策略,完全靠检索器给LLM提供精准信息。

结果怎么样?

RAG评估结果表

如上表所示,Blended RAG在生成式问答领域表现相当惊艳——即便没有针对特定数据集微调,F1分数也提升了50%。这个特性对企业级应用意义重大:大型企业数据集往往无法直接微调,或者微调成本高到难以实施,Blended RAG正好切中了这个痛点。

局限性

稀疏向量索引与密集向量索引的权衡

这里有一个关键权衡值得注意。HotPotQA语料库包含500万份文档,生成的密集向量索引大约有50GB,严重影响了处理效率。密集向量索引以快速索引能力著称,但

查询性能相对较慢

。与此相反,稀疏向量索引虽然索引速度较慢,却能提供

更快的查询体验

。两者在存储需求上的差异非常明显——例如,HotPotQA语料库的稀疏向量索引仅占用了10.5GB空间,而相应的密集向量索引则需50GB。

对于数据量如此庞大、需要兼顾效率的企业来说,

建议优先采用稀疏编码器索引

。同时,采用多租户联合搜索查询也会更高效。

缺乏元数据的混合检索器

当数据集包含元数据或其他相关信息时,混合检索器的效果会更上一层楼。但像CoQA这样缺乏元数据的数据集,效果就没有那么显著了——说明这套方案对元数据的依赖度不低。

一些结论

  • 通过混合搜索优化检索器:结合语义搜索,特别是与“最佳字段”查询相结合的稀疏编码器索引,已成为目前所有方法中的最优结构。
  • 通过混合检索器增强RAG:检索准确率的提升在完整RAG流程的评估中得到了充分验证,其表现显著超过了此前微调集上的基准。
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc