来源:互联网 更新时间:2026-08-01 14:01
大模型在处理长文本时,一个绕不开的痛点就是推理成本——序列越长,计算量按二次方往上飙,部署起来成本高得吓人。更头疼的是,模型还容易“分心”,那些无关的上下文一多,输出的质量就往下掉。

为了破这个局,最近有研究提出了一种新的RAG提示方法——
它的核心思路,是把输入的文本段落(比如系统提示、文档和用户查询)构建成一个有向无环图。简单说,每个节点代表一段标记序列,边代表注意力依赖关系。这样一来,模型可以并行处理所有与查询相关的文档,同时通过路径剪枝机制,果断丢掉那些不相关的上下文。利用LLM自身的logits就能判断哪些内容该剪掉,长上下文推理的效率自然就上来了。
为了把速度再提一个台阶,这个方法还搭配了几项优化。比如
实验数据很能说明问题。在NaturalQuestions-Open数据集上,用MPT-7B指令调整模型,超位置提示相比传统RAG,计算时间减少了93倍,准确率还提高了43%。在MuSiQue这个多跳推理数据集上,效果同样出色。而且,这些提升是在不额外训练或微调模型的前提下实现的——光凭提示设计和结构优化,就能达到这种效果。
下图展示了在NaturalQuestions-Open上的对比结果——超位置提示在准确性和加速两方面都明显优于基线。对于具有超参数的基线(BM-25、TF-IDF、Contriever),展示了它们最高准确性的配置。超位置提示的优越性一目了然。
在MuSiQue数据集上,各种模型的检索增强生成准确性。对于超位置提示,t表示迭代超位置的迭代次数,k表示在每一步选择的前k个(即未剪枝的)。
Superposition Prompting: Improving and Accelerating Retrieval Augmented Generation https://arxiv.org/pdf/2404.06910.pdf