来源:互联网 更新时间:2026-07-28 15:23
用好大模型,关键在于为不同任务设计合理的提示策略。典型的代表方法之一是
一个有效的提示离不开四个关键要素:
先看三个直观的例子(question answering、meta-review generation、Text-to-SQL),图中蓝色部分为任务描述,红色为上下文,绿色为示例,金色为提示风格:


任务描述是LLM需要遵循的指令,要清晰地说明任务目标。如果输入或输出格式特殊,需要详细说明,甚至可以用关键词突出强调,从而更好地引导模型。
多数情况下,自然语言描述直接简单。但对于知识图谱、表格等结构化数据,需要先“线性化”为可读的序列(比如把三元组转成文本)。编程语言也是一种好方法,还可以配合外部程序执行器得到更精确的结果。
除了任务描述和输入数据,某些任务特别依赖背景信息。例如开放域问答中检索到的文档就是支持证据,文档质量和相关性直接影响答案质量。因此需要以恰当的模板或格式包含这类信息。另外,上下文中的任务示例有助于模型理解复杂任务的目标、输出格式和映射关系。
不同模型对提示风格的敏感度不同。总体而言,应当把提示写成清晰的问题或详细的指令。在某些场景下,添加前缀或后缀能有效提升效果——例如前缀“让我们逐步推理”能引导模型分步思考,前缀“您是该任务的专家”可提高特定任务的表现。对于ChatGPT这类聊天式模型,与其一次性给出长而复杂的提示,不如拆分成多个子任务提示,通过多轮对话逐次输入。
基于关键要素,总结几条实用原则:
除了设计原则,现有经验和研究还总结了一些实用技巧(详见下表12)。需要说明的是,这些提示通常以通用方式给出,并不一定是特定任务的最佳方案。
为了展示提示对任务性能的实际影响,我们选了几个典型任务(语言生成、知识利用、复杂推理、结构化数据生成、信息检索)做了对比实验。每个任务分别使用遵循上述原则的精心设计提示和一个简化提示。以下几条结论值得注意:
手动创建提示直观但耗时,而且模型对提示很敏感,一个不好的提示可能大幅拉低性能。因此大量研究提出了自动化优化方法,主要分为
离散提示由自然语言标记组成,简单灵活,但搜索空间巨大。现有方法包括基于梯度的、基于强化学习的、基于编辑的和基于LLM本身的几种。
连续提示由连续嵌入组成,可通过下游任务的损失梯度直接更新。这类研究主要在PLM时代流行,在LLM时代因参数量过大而关注有限。主流方法包括:有足够标注数据时的直接学习,以及数据稀缺时的迁移学习。
作为一种特殊的提示形式,上下文学习(ICL)最早随GPT-3提出,如今已成为使用LLM的典型方法。
如前所述,ICL使用自然语言提示,包含任务描述和/或几个示例(演示)。图14展示了过程:先准备好任务描述,从数据集中选择若干示例,按照特定顺序组合成提示,最后把测试实例附在末尾输入LLM,让模型在无梯度更新的情况下生成输出。

整个流程可用公式表示:

其中 I 为任务描述,Dk 为演示,xk+1 为查询输入。由于ICL性能严重依赖演示,设计时需要重点关注三个方面:如何选择示例、如何格式化每个示例、以及如何安排顺序。
下面从演示设计和底层机制两个角度展开。顺便提一下,ICL与指令调优关系密切,但指令调优需要微调模型,而ICL只在使用时提示模型;同时指令调优能增强LLM在zero-shot设置下的ICL能力。
不同演示示例会导致天差地别的性能,因此选择哪些示例是关键。主要方法分两种:
无论哪种方法,选出的演示都应该包含与任务和查询相关的足够信息。
选定示例后,需要把它们集成到提示中。简单做法是用预定义模板实例化输入输出对。更高级的做法包括添加任务描述或使用思维链增强推理能力。例如,有研究收集了人类编写的任务描述数据集,微调后不仅提升了可见任务性能,还能泛化到未见任务。为了减少人工成本,一种半自动化方法用少量种子描述引导LLM为新任务生成任务描述。
Auto-CoT和least-to-most prompting是两种代表方法:前者用“让我们逐步思考”激发LLM自动生成推理步骤;后者先让LLM分解问题,然后顺序解决子问题。
LLM有时会受“近因偏差”影响——容易重复演示末尾的答案。因此合理安排示例顺序很重要。早期工作提出了一些启发式方法,比如按嵌入空间中与查询的相似度排序。
预训练后的LLM在不更新参数的情况下展现出惊人的ICL能力,这引发了两个核心问题:预训练如何影响ICL?推理时LLM如何执行ICL?
ICL能力随模型规模增大而显著增强。一些研究表明,专门设计的训练任务(如持续预训练或微调)能让小规模PLM也具备不错的能力。此外,理论分析指出,ICL可解释为在具有远程连贯性的文档上进行预训练的结果;基于next-word prediction的LLM能从语言数据中存在的组合结构学到ICL能力。
推理时有两种主要机制:
最近的研究指出,任务识别和任务学习所需模型规模不同:任务识别能力更容易获得(350M参数的小型LM也能展现),而任务学习至少需要66B参数的LLM。小型LM倾向于依赖先验知识而忽略标签,大型LLM则能超越先验知识,从演示中获取新知识。为了提升任务学习能力,Meta-In-Context Learning建议在提示中包含多个相关任务,符号调整则强制模型从语义无关标签的演示中学习。
思维链提示是一种改进策略,能显著提升LLM在算术、常识、符号等复杂推理任务上的表现。与ICL直接用输入输出对不同,CoT在输入和输出之间加入了中间推理步骤作为桥梁。下面先介绍基础方法及其改进,再讨论何时有效以及为什么有效。
CoT最初作为ICL的扩展提出:每个演示从 <输入,输出> 扩充为 <输入, CoT, 输出>,其中CoT是一系列中间推理步骤。LLM通过这些增强的演示为新输入生成CoT和答案。但CoT的获取通常需要人工注释。好在研究发现,用“让我们逐步思考”“take a deep breath and work on this problem step by step”等简单指令就能触发LLM自动生成CoT,大大降低了使用门槛。
图15展示了CoT的生成过程,遵循链式结构,逐步生成:

通常CoT采用自然语言格式。但对于需要严格逻辑的复杂任务,文本可能不够精确,因此有些工作使用代码格式,利用其结构化、精确的性质;也有方法动态选择文本或代码来结合两者优势。
尽管CoT提高了复杂推理性能,但仍存在推理错误和不稳定性。以下从更好的提示设计、增强生成策略、以及推理结构扩展三个方面介绍改进方向。
提示本身对CoT性能至关重要。直观的方法包括使用不同的CoT(每个问题多条推理路径),或者采用更复杂推理路径的提示来激发LLM的推理能力。但所有这些方法都依赖带注释的CoT数据集。为了摆脱限制,“让我们逐步思考”等神奇指令可以用来自动构建CoT。
LLM容易产生不正确的推理步骤且表现不稳定。两种典型增强方法:
链式结构限制了处理需要前瞻和回溯的复杂任务。因此研究提出了
CoT推理是一种涌现能力,只对足够大的模型(通常10B以上参数)有正面影响,对小模型无效。它主要对需要逐步推理的任务有效(算术、常识、符号推理),而对于不依赖复杂推理的任务(如GLUE中的MNLI、SST-2、QQP),CoT可能导致性能下降。有趣的是,当标准提示本身结果很差时,CoT带来的收益才显著。
从两个角度解释:
ICL和CoT提示是通用但简单的方法,然而在处理数学推理、多跳问答等复杂任务时仍显吃力。基于提示的

摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
电视剧《罗曼诺夫后裔》剧情介绍
暗黑4S14野蛮人终局BD攻略
区块链OTC交易所有哪几家比较正规?
什么是山寨币?山寨币指数如何查看?全球前10大山寨币盘点
Binance新增15种bStocks代币化证券为杠杆抵押资产
全球十大加密货币APP v3.11.5正版下载
GLM-4.5发布,全网最全测评和使用教程来了!
洛的网名三字男生霸气(精选100个)
本周比特币行情预判:BTC后市的三种推演与两强对决
剑侠世界3雪峰论剑怎么打-剑侠世界3雪峰论剑打法介绍
Meme币DOGS今晚上线!开局就解锁91%代币是否带来风险?
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
姓徐和李取网名男生霸气(精选100个)
25年来最惨单月 微软市值本月重挫近4万亿:押注AI也没赢麻
超长高标准质保+总部直保售后体系:小牛真实售后体验大起底
比特币守住关键支撑,HYPE市值升至第九并反超DOGE
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc