检索增强生成(RAG)常被视作对抗大模型幻觉的一把利器,既能补上最新知识,也能为模型提供“参考答案”。但这里有个关键问题:当大模型靠自己就能答对时,塞给它正确的检索内容,它能被“纠正”吗?反过来,如果检索内容本身有误,模型是能够“免疫”还是照单全收?

斯坦福大学的研究团队对此做了一次系统性的剖析,核心聚焦于
LLM的内部知识(也就是它的“先验”)与检索信息之间那场看不见的拉锯战
,尤其是当两者“唱反调”时,模型到底听谁的。实验结果很有意思,值得每个做RAG应用的人留意。
在包含参考文档和不包含参考文档的两类场景下,测试了GPT-4和其他大模型的问答表现。结果符合预期:给出正确的检索信息,确实能把模型的大多数错误拉回正轨,准确率飙到了94%。
但当参考文档里被故意掺入越来越多的错误值时,麻烦出现了。如果模型自身的先验知识比较弱,它很容易被错误的检索信息带偏;反之,如果模型对某个问题的先验“底气很足”,它就不太会跟着错误信息走。
进一步分析还发现,检索修改后的信息与模型先验答案之间的偏差越大,模型就越倾向于坚持自己的判断,而不是采纳检索内容。
以上现象共同指向一个核心事实:模型的先验知识与检索信息之间存在一种天然的张力,在实际应用中,这种张力决定了RAG究竟是在“助攻”还是在“搅局”。
实验方法
研究人员从六个不同领域(包括药物剂量、体育统计、新闻、日期、姓名和城市)生成了问答对。具体做法是先通过专业网站和维基百科等渠道抓取内容网页,再用GPT-4基于这些文本自动生成问题和答案。
接下来,通过计算模型在有上下文和无上下文情况下生成的答案与参考答案之间的一致性,来评估模型的“听话程度”。
最关键的一步是对检索文档进行系统性的“篡改”。对于数值型数据集,研究人员对原始值进行了乘数修改;对于分类数据集,则做了手工修改。这些经过修改的文档随后作为上下文与问题一起提交给大模型,同时收集答案和输出令牌的对数概率。
:先向LLM提问,尝试有无参考文档两种情况。然后,给参考文档“注入”修改后的信息,再作为上下文提交给LLM。最后观察它是倾向于采纳修改信息,还是坚持自己的先验答案。
在对比分析环节,研究人员先在没有上下文的情况下查询LLM,随后在提示中加入检索内容再次查询。通过两次响应的对比,判断模型是更偏好自己的先验知识还是更偏好RAG提供的信息。RAG偏好率通过所有RAG查询结果的平均值计算得出。下图中展示了来自三个数据集的示例,
。
此外,还分析了不同提示策略的影响,包括“标准”“严格”和“宽松”三种提示风格,旨在控制模型对检索上下文的依赖程度。
详细实验结论
一致性
- 在没有上下文的情况下,LLM生成的答案与参考答案一致的平均比例仅为34.7%。这个数字说明,模型自身的先验知识覆盖面有限,出错概率非常高。
- 引入RAG后,一致性显著提升到了94%。可以说,RAG在引导模型遵循检索内容方面确实非常有效。
- 不过,即便有正确的检索内容,在少数情况下模型仍然“顽固不化”,大约有20%的几率会直接搬出自己原来的先验答案,对检索信息视而不见。
。“先验”对应GPT-4无上下文时的表现,“w/ RAG”对应提供相关检索上下文时的表现。图中还标出了先验概率与RAG偏好率之间的斜率。例如,平均斜率为-0.23,意味着先验令牌概率每增加10%,模型偏好RAG的可能性会降低2.3%。
RAG偏好率与先验概率的关系
- 模型先验答案的令牌概率与其RAG偏好率之间呈现出一致的负相关关系。也就是说,模型对某个答案越自信,它就越不愿意被RAG带跑。
- 把概率分成十个等距区间后,能看到不同斜率(范围从-0.1到-0.45),这表明RAG在不同问答领域的有效性,很大程度上取决于模型内部先验信心的强弱。
- 拿斜率-0.45来说,它意味着每当模型的先验响应概率增加10%,LLM偏好上下文信息的可能性就会减少4.5%。
。左侧图表展示了先验概率(分为10个区间)与RAG偏好率的关系,右侧图表则展示了检索信息与先验的偏差程度与RAG偏好率的关系。右侧图表中还标注了上下半百分位数,可以明显看到,先验概率较低的响应,其RAG偏好率也系统性更低。
RAG偏好率与偏离先验值的关系
- 除了概率,偏差程度也是一个关键变量。研究显示,随着RAG提供的信息与模型先验答案的偏差越来越大,模型采纳RAG信息的可能性也随之降低。
- 通过将数据分为上下半百分位数,所有六个数据集都呈现出同一个规律:低概率先验响应的RAG偏好率,单调低于高概率响应令牌。
不同提示技术对RAG依从性的影响
- 为了评估提示措辞的影响,研究人员在GPT-4上测试了“严格”和“宽松”两种变体。严格提示要求模型字面遵循检索上下文,宽松提示则鼓励模型在回应前进行合理判断。
- 结果与预期一致:严格提示的RAG依从性普遍高于标准提示;而宽松提示随着先验概率的增加,RAG依从性下降得更快、更陡。
。严格提示强烈要求字面遵循,宽松提示鼓励基于上下文做出合理判断。宽松提示下,RAG依从性不仅更低,而且下降斜率更陡,说明提示措辞在控制RAG依从性中扮演着重要角色。
GPT-4、GPT-3.5和Mistral-7B之间的差异
- 用GPT-3.5和Mistral-7B重复同样的分析后,发现这两个模型在先验一致性和RAG表现上都明显弱于GPT-4。
- 不过,虽然绝对性能有差距,它们仍呈现出了与GPT-4相同的负相关趋势——这点很有意思,说明模型规模虽然影响“底气”,但机理上的规律是共通的。
图4:GPT-3.5和Mistral-7B的一致性与斜率对比
。请参照图1中的完整表格描述。
图5:三个模型(GPT-4蓝色、GPT-3.5橙色、Mistral-7B绿色)在RAG偏好率与先验概率及偏差上的对比
。值得注意的是,某些模型在某些数据集中未能生成有意义的先验响应(因拒绝或不当响应等原因),因此部分分析存在缺失。
说到底,RAG并非万能的“制幻药”。它的效果高度依赖于模型内部的先验信心、检索信息与先验的偏差程度,以及提示词的设计。在构建和部署RAG系统时,真正需要关注的,不是“有没有RAG”,而是“RAG和模型先验之间的博弈如何精细地平衡”。