来源:互联网 更新时间:2026-08-22 13:56
大语言模型在各类语言任务中展现出了惊人的零样本泛化能力,搜索引擎自然也不例外。不过,现有研究大多集中在利用LLM的生成能力来做信息检索,却很少有人直接拿它来做段落排序。这篇EMNLP 2023的杰出论文(Outstanding Paper)干脆把问题摆到台面上:LLM到底擅不擅长搜索排序?
论文标题:Is ChatGPT Good at Search? Investigating Large Language Models as Re-Ranking Agents(https://aclanthology.org/2023.emnlp-main.923/)
核心围绕着两个问题展开:
针对第一个问题,论文提出了一个叫“排列生成”(permutation generation)的方案——让LLM直接输出一组段落的排序组合,而不是先算相关性分数再排。针对第二个问题,则用蒸馏技术,把ChatGPT的排序能力迁移到更小的专用排序模型上。
具体来说,零样本段落重排序有三种常见的指令模式(如下图,灰色和黄色块分别代表模型输入和输出):
论文选的是最后一种:把一组段落喂给LLM,每个段落配一个唯一标识符(比如[1]、[2]……),然后要求LLM根据段落与查询的相关性,输出一个降序排列的顺序。格式类似 [2] > [3] > [1] > [...] 。这种方法直接输出排序,不产生中间相关性分数,有点像list-wise的思路。
排序用的prompt模板分两种:
text-da vinci-003:gpt-3.5-turbo 和 gpt-4:考虑到LLM的输入长度限制,论文用了滑动窗口策略来处理更多文档。直接看示例:
第一步先对第5–8位排序,p8和p5胜出;第二步对第3–6位排序,p8和p3胜出;最后对第1–4位排序,得到最终结果。滑动窗口的方案简单直观,但从全局看,它有个潜在问题——不同段落之间的排序未必存在偏序传递关系。比如图中的p4和p5未必就比p6和p7更优。当然,眼下LLM的长度限制已经不再是瓶颈,这个策略的意义也就不那么大了。
另一方面,成本是个现实问题,用GPT-4做排序实在贵得离谱。因此很自然的想法是把GPT-4的排序能力蒸馏到小模型上。论文从MS MARCO里抽了10,000个查询,用BM25为每个查询检索20个候选段落,然后让学生模型去拟合ChatGPT对这些段落的排序输出。
上表是TREC和BEIR数据集上的评估结果,几个关键发现:
上表是TREC数据集上的消融实验,有几个有意思的结论:
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
WorkBuddy微信版怎么获得积分?
车载冰箱重置到出厂设置几步?
5000元起的鼠标哪个最值得入手?
比特币 2025 年价格预测:BTC 的未来走势
笔记本移动电源推荐哪款?
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
Aptos(APT)2026-2032年价格预测与历史走势梳理
短剧《仙人跳获透视,古玩玉器我全拿捏》剧情介绍
腾讯ima知识库怎么分类管理?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc