来源:互联网 更新时间:2026-08-05 16:48
先说几个核心判断:检索增强(RA)技术确实是当前缓解大语言模型(LLMs)幻觉问题的常用手段,但“每次必检”并非最优解。原因很简单——检索本身并非免费午餐,它既带来额外的计算开销,检索到的文档质量也难以保证。更合理的策略,其实是在模型真的需要帮助时才去检索。换句话说,只有当LLMs对某个问题表现出不确定时,才启动外部检索。这听起来直觉上很对,但问题在于:LLMs真的能准确判断自己“不知道”吗?
这篇研究正是围绕这个问题展开。作者首先定量评估了LLMs识别自身知识边界的能力,结果发现一个普遍现象:大模型普遍存在“过度自信”的问题。在此基础上,研究进一步探讨了模型对问题的确定性与对外部信息的依赖程度之间的关系,并提出了几种增强模型知识边界感知的方法。最终成果是:在减少检索调用次数的同时,LLMs能够达到甚至超越常规检索增强的性能表现。
持续进行检索增强并非理想选择,背后有两点现实考量。其一,检索带来的额外开销不容忽视;其二,检索到的文档质量不可控。当模型本身已经具备相关知识时,求助于外部信息实属多余,而一个表现不佳的检索器甚至可能对模型产生负面影响。因此,提升效率的关键在于强化LLMs对自身知识边界的感知能力——说得直白些,就是让模型学会“承认自己不知道”。只有降低它们的过度自信,才能实现更高效的自适应检索增强。
实验使用了两个开放域问答基准数据集:Natural Questions(NQ,测试集)和 HotpotQA(多跳推理,验证集)。只选取了含有短答案的问题,并将短答案作为标签。
评估覆盖了开源和闭源两类模型:开源方面选用了 Vicuna-v1.5-7B 和 LLaMA2-Chat7B;闭源方面则包括 GPT-Instruct(gpt-3.5-turbo-instruct)、ChatGPT(gpt-3.5-turbo-0301)和 GPT-4(gpt-4-1106-preview)。
准确率:如果回答包含真实答案,即视为正确。
不确定性回答比例(Unc-rate):用于衡量模型的信心水平,比例越低表示模型越“自信”。
研究还提出了三个新指标,专门用于评估模型对知识边界的感知能力:
Alignment = (Ncc + Niu) / N:综合感知水平
Overconfidence = (Nic) / N:过度自信程度
Conservativeness = (Ncu) / N:保守程度
其中 N = Ncc + Nic + Ncu + Niu
作者选取了代表性模型,使用基本提示词测试它们的问答性能和知识边界感知水平。结果非常说明问题:
第一,所有模型都表现出明显的过度自信,即便是目前最强的 GPT-4 也未能幸免。以 NQ 数据集为例,GPT-4 只能正确回答不到 49% 的问题,但在 18.94% 的情况下却错误地认为自己给出了正确答案。第二,过度自信现象远严重于保守性,这说明模型对自身知识边界的不清晰感知,核心问题就在于“太相信自己”。第三,准确率与知识边界感知之间并没有明显的相关性——准确率更高的模型,对齐程度反倒可能更低。换句话说,在对话数据上的进一步训练可能提升了知识边界感知,但同时牺牲了一定的问答性能。
提示词如下:
[此处为原始提示词,未提供具体内容]
在检索增强场景下,我们需要知道一个关键问题:当模型表现出不确定性时,它是否会主动利用外部信息?本节研究正是聚焦于此——考察模型的信心水平如何影响其对外部文档的依赖程度。
作者使用两种提示方式(vanilla 和 Punish+Explain)引导模型输出其对回答正确性的确定性判断,并根据两次回应(c 和 ĉ)将确定性分为四个级别: 级别 0: c = 0, ĉ = 0;级别 1: c = 0, ĉ = 1;级别 2: c = 1, ĉ = 0;级别 3: c = 1, ĉ = 1。信心级别从 0 逐级递增至 3。
研究中使用了两种文档类型:黄金文档(包含正确答案的文档)和腐败文档(正确答案被替换为“Tom”的文档)。模型被要求自行决定是依赖内部知识还是依赖文档来回答问题。通过两个指标衡量文档依赖性:
利用率:对于给定问题 q 和文档 d,如果 Overlap(â, d) - Overlap(a, d) > γ,则推断模型依赖文档。本文设定 γ = 0。
腐败率:a 正确而 â 错误的问题百分比。
结果显示一个清晰的趋势:随着置信度提高,所有模型对文档的依赖性都呈下降趋势。这意味着当模型表达不确定性时,它们确实更倾向于依赖外部文档。但值得注意的是,无论文档内容是否正确,模型对文档的整体依赖性都相当高。这提醒我们:LLMs 倾向于信任输入内容,因此在利用检索增强时需要格外谨慎,尤其是当检索器性能不佳时。这恰恰凸显了自适应检索增强的重要性。
既然 LLMs 对知识边界的负面认知主要源于过度自信,那么减轻过度自信就成了增强知识边界认知的关键。作者从两个角度入手:让模型更谨慎,同时提升其提供正确答案的能力。
减轻过度自信的方法包括:
1. 督促模型谨慎:惩罚(在提示中加入“如果答案不正确但你说确定会受到惩罚”)、挑战(质疑生成答案的正确性)、逐步思考(要求模型先逐步思考再输出自信度)。
2. 提升问答性能:生成(让模型自生成有助于回答问题的文档)、解释(要求模型解释答案的推理过程)。
实验结果揭示了几个重要发现:
第一,所有促使模型谨慎的方法都增加了不确定性响应的比例。其中,“挑战”方法效果最强,但同时也导致模型过度保守。相比之下,“惩罚”方法在降低过度自信的同时不会让模型变得过度保守,表现更为均衡。“逐步思考”的效果则因数据集而异,并不稳定。
第二,所有提升 QA 性能的方法都提高了答案准确性,但存在副作用。“生成”方法虽然提高了准确率,却也带来了最高的过度自信分数——模型似乎相信了自己生成的文档,反而更“自信”了。“解释”方法则是个例外,它通常能在提升准确率的同时减少过度自信,效果更为理想。
第三,不同模型有不同偏好。“惩罚”方法对 LLaMA2 特别有效,而“解释”方法在 GPT-4 上表现最佳。这背后可能的原因是:LLaMA2 过度自信严重且生成能力弱,而 GPT-4 本身过度自信水平较低,生成能力强。将“惩罚”和“解释”合并为 Punish+Explain 方法后,持续实现了对齐度的提升而不影响准确性。
本节介绍的是本文的核心贡献:如何判断何时需要检索,而不是所有时刻都触发检索。作者在两种设置下进行对比:静态检索增强(为所有问题启动检索)和自适应检索增强(仅在模型认为无法回答时检索)。
检索器方面,使用了三种文档来源:Sparse(BM25)、Dense(RocketQA v2)和 Gold(包含正确答案的文档)。为简化实验,仅向 LLMs 提供排名第一的文档。
关键发现如下:
第一,当使用黄金文档时,静态增强在几乎所有情况下都实现了最高准确性,这并不意外。但在自适应检索增强中,Punish+Explain 方法表现最优,且与静态增强的差距并不显著,甚至在某些场景下持平或超越,同时调用检索的次数大幅减少。例如,ChatGPT 在 Punish+Explain 策略下仅使用了 40.6% 的检索调用,便在 HotpotQA 上取得了最佳成绩。
第二,自适应检索增强使 LLMs 对低质量文档更加鲁棒。当使用稀疏检索器检索到的文档时,静态增强在 NQ 上经常导致性能下降——因为模型本身在这些问题上表现良好,低质量文档反而造成了干扰。自适应增强则有效减少了性能损失,甚至实现了提升。
第三,在真实搜索场景中,Explain 和 Punish+Explain 策略比静态增强更有效。当文档确实有助于提高准确性时,自适应检索增强能够实现与静态增强相当甚至更优的性能,同时显著减少不必要的检索开销。虽然自适应检索增强需要两轮推理来判断是否需要增强,但需要增强的比例很小,因此整体效率仍然是显著提升的。
这篇文章的核心贡献可以归纳为几点:首先,作者提出了几个新的度量标准,对 LLMs 的知识边界感知能力进行了定量评估,并明确指出模型在“是否知道答案”和“实际回答表现”之间的不匹配,主要源于过度自信。其次,研究揭示了 LLMs 对问题的确定性与外部信息依赖程度之间的明确关系——模型越不确定,就越倾向于依赖文档。在此基础上,作者提出了几种有效的提示策略来减轻过度自信。实验证明,这些方法能够显著增强模型对自身知识边界的认知,最终实现更高效的检索增强——用更少的检索调用,换来与常规检索增强等同甚至更好的性能表现。
值得特别强调的是,这项研究不仅提供了一个方法论框架,更给出了一个清晰的实践启示:不是所有的知识都需要“查”,关键是知道什么时候该“查”。这背后,是对模型“认知自我”能力的更深层次追问。
[1] https://arxiv.org/abs/2402.11457
Ondo将于今日上线股票永续合约
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
区块链OTC交易所有哪几家比较正规?
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
macOS 28将移除Rosetta 2兼容层,Intel应用面临运行危机
异环伊洛伊阵容怎么搭配
《探索流放之路物品等级的奥秘》 揭秘物品等级的效果和怎么查看
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
潜水员戴夫丛林DLC接吻的鱼任务攻略
电视剧《白领公寓》剧情介绍
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
电视剧《钟鼓楼》剧情介绍
Windows环境下Claude Code从C盘迁移至D盘的完整操作教程
AMD Zen6处理器跑分还再涨!同核心提升达35%
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc