热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Apple提出Superposition Prompting:用于提升大模型RAG效率和准确性的新提示方法

Apple提出Superposition Prompting:用于提升大模型RAG效率和准确性的新提示方法

来源:互联网 更新时间:2026-08-01 14:01

大模型在处理长文本时,一个绕不开的痛点就是推理成本——序列越长,计算量按二次方往上飙,部署起来成本高得吓人。更头疼的是,模型还容易“分心”,那些无关的上下文一多,输出的质量就往下掉。

Apple提出Superposition Prompting:用于提升大模型RAG效率和准确性的新提示方法

为了破这个局,最近有研究提出了一种新的RAG提示方法——

超位置提示(Superposition Prompting)

。这招儿可以直接用在预训练的Transformer模型上,完全不需要微调,算是个轻量级的利器。

核心思路:把输入织成一张网

它的核心思路,是把输入的文本段落(比如系统提示、文档和用户查询)构建成一个有向无环图。简单说,每个节点代表一段标记序列,边代表注意力依赖关系。这样一来,模型可以并行处理所有与查询相关的文档,同时通过路径剪枝机制,果断丢掉那些不相关的上下文。利用LLM自身的logits就能判断哪些内容该剪掉,长上下文推理的效率自然就上来了。

加速推理:缓存、并行和智能剪枝

为了把速度再提一个台阶,这个方法还搭配了几项优化。比如

路径缓存

,把键值嵌入缓存起来,在线服务时直接复用,省掉从头计算的重复劳动。再比如

路径并行化

——因为各个路径互相独立,可以并行算它们的KV缓存和logits,用户感知的响应时间自然就短了。此外,还有一套平衡位置分配策略,确保每个标记在图中都有恰当的位置;以及基于贝叶斯路径显著性的剪枝方法,用概率论的办法精准量化文档和查询的相关性,该留的留,该扔的扔。

图2 超位置提示与传统的(Naive LLM-RAG)提示范式的比较。

正方形代表一个标记(token),箭头表示注意力依赖关系。传统的方法是

“链表”风格的有向无环图(DAG)

,而超位置提示则

安排标记依赖关系,使得所有文档都能独立处理

。由于这种依赖结构,可以轻松地利用

LLM的logits来剪枝无关的上下文

,从而提高长上下文推理的能力。这种依赖结构还允许更快的提示处理,因为有了新的缓存和KV缓存及logit计算的并行性机会(每个灰色框表示LLM处理的一个逻辑“批次”,重用上游KV缓存)。

图3 在“在线服务”期间必须计算的内隐注意力依赖关系((b)-(f)中的颜色对应于图2中的标记段颜色)

。注意各种优化如何通过剪枝、预计算和并行化工作来减轻在线服务时所需的计算负担。值得再次强调的是,在实践中,推理不是对一个大型序列的稀疏注意力,而是对许多不同较短标记段的密集注意力。

实验效果:速度和精度双双起飞

实验数据很能说明问题。在NaturalQuestions-Open数据集上,用MPT-7B指令调整模型,超位置提示相比传统RAG,计算时间减少了93倍,准确率还提高了43%。在MuSiQue这个多跳推理数据集上,效果同样出色。而且,这些提升是在不额外训练或微调模型的前提下实现的——光凭提示设计和结构优化,就能达到这种效果。

下图展示了在NaturalQuestions-Open上的对比结果——超位置提示在准确性和加速两方面都明显优于基线。对于具有超参数的基线(BM-25、TF-IDF、Contriever),展示了它们最高准确性的配置。超位置提示的优越性一目了然。

在MuSiQue数据集上,各种模型的检索增强生成准确性。对于超位置提示,t表示迭代超位置的迭代次数,k表示在每一步选择的前k个(即未剪枝的)。

Superposition Prompting: Improving and Accelerating Retrieval Augmented Generation
https://arxiv.org/pdf/2404.06910.pdf
关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc