来源:互联网 更新时间:2026-08-12 15:56
要跟上Prompt技术的最新发展,光靠网上的新闻报道和解读文章远远不够。那些动辄给自己戴上"专家"、"大师"头衔到处蒙人的人,十个有九个连下面这张图里的东西都说不清楚。

这篇文章约9100字,阅读时间约23分钟。
上周发布的那篇Prompt系统调查报告,因为篇幅所限,有几张极其重要的图片没有展开细说。结果发现,一堆抄袭的文章扑面而来,关键是都抄不到点子上,甚至连图片里的英文都翻译不对。为了让各位能擦亮眼睛,特写此文以正视听。
那篇报告中最有价值的部分,毫无疑问就是上面这三张图。你看,被引用1000次以上的Few-Shot、Zero-Shot、Chain-of-Thought这些技术,可以说是Prompting领域的几大支柱。任何一个真正在做Prompt研究的人,不可能不了解它们的来龙去脉。反过来说,如果谁对这些技术一窍不通,却还在到处宣扬什么Prompt秘籍、Prompt提升,那真是让人笑掉大牙。可以预见的是,这篇文章一出,某些人又会抛出一堆核心论文,或者再搞一个什么核心研读提升元认知、精品课程之类的套路。
再看看这张模型使用统计图:GPT、BERT高居榜首,用得最多。这不是废话吗?这些顶级语言模型,性能好、能力强,自然是各种Prompt方法争相尝试的"香饽饽"。连这个都不懂,还指望玩转Prompt?
最后这张图就更有门道了:CoQA、MMLU、HellaSwag……这些可都是Prompt领域的标准测试数据集。
这三张图中,最重要的是每种Prompt技术的具体引用数量。高引用量意味着什么?说明这项技术适用面广,跨任务、跨领域的泛化能力强,具备工业环境部署的实用性。CoT Prompting、Selection-Inference这些,看着就犀利。Self-Consistency、Least-to-Most Prompting等,都是在不同角度上增强了Prompt的表现力和鲁棒性,让模型能更好地理解任务需求,给出高质量响应。更关键的是,引用多了,围绕这项技术的各种改进、优化、融合的尝试也就多了。学界有个著名的"马太效应":好的技术天然吸引更多目光,大家在它基础上做文章,反过来又进一步提升了它的引用量。这是个良性循环。引用量Top榜上的这些Prompt方法,不仅代表了当下最实用的技术,也奠定了未来进一步创新的基础。
研究一篇高引用论文,至少应该这样整理。
这些论文共37篇,用程序跑出来的中英文摘要近70000字。当然,你也可以用下文这些蓝色的关键字检索、检索、再检索。注意看:《The Prompt Report: A Systematic Survey of Prompting Techniques》这份报告的作者对Few-Shot这篇原文的引用量是1000多一些(限定研究范围1565篇论文),而实际引用(Cited)的数目是26975。这意味着,你每次写Prompt时用Few-Shot,大概率上是正确的,原因就在这里。
接下来,对这37项技术做一个简要介绍。"纸上得来终觉浅,绝知此事要躬行",希望本文能抛砖引玉,让你获得真正的"良知"。
包含8.5K多道小学数学应用题,题目来自真实的教材、考试和网络。每道题都需要常识推理和多步解题,全面考察模型的数学推理能力。被广泛用于评测Prompting模型在算术推理方面的性能,如Chain-of-Thought Prompting等。
一个庞大的多任务基准测试,涵盖57个学科,包括人文、社会科学、STEM等。共有14K个多选题,每个学科有若干个子类别。题目取材于高中和大学课程。全面评估模型在不同领域知识的掌握和运用能力,被视为语言模型通才能力的检验标准。
包含约100K道代数问题,每道题都要求给出详细的解题步骤。题目根据难度分为Easy、Medium、Hard三个等级,涵盖了代数的方方面面。不仅考察模型的数学运算能力,更注重解题过程的逻辑性和可解释性。
一个侧重事实准确性的问答数据集,包含多个不同领域的问题。除了给出答案外,还需判断答案是否真实可信,以及给出可信度评分。旨在评估模型对事实的判断力,以及面对误导、违规内容时的鲁棒性。
一个考察常识推理的数据集。给定一个场景描述,要求从多个候选中选出最合理的后续。候选答案往往差异很微妙,需要模型深入理解语境,捕捉细微线索。评测模型在日常场景下的推理判断能力,体现其常识知识的掌握。
一个基于语义组合的问答数据集。每个问题都需要组合多个事实才能回答。事实来自一个大规模的语料库,涉及多个领域。评测模型的多轮推理和知识整合能力。被认为是一个很有挑战的数据集,对知识型问答系统的构建具有重要价值。
一个侧重常识推理的问答数据集。给定一个问题,要求从多个候选中选出最合理的答案。问题涉及日常生活的方方面面,评测模型对世界知识的理解和运用。被广泛用于评测模型在常识推理任务上的表现,如Promptless One-Shot learning等。
一个考察指代消歧的数据集。给定一个句子和一个代词,要求判断该代词指代的是哪个名词。需要模型深入理解句子语义,利用常识知识进行推理判断。评测模型在复杂语境下进行指代消歧的能力,对自然语言理解有重要意义。
一个全面评估大语言模型能力的基准测试,包含150+个不同类型的任务。任务涵盖阅读理解、常识推理、数学计算、创意生成等多个方面,难度不一。被视为评判大模型综合能力的"体检表",在业界和学界都有广泛影响力。
BIG-bench的一个子集,精选了其中最具挑战性的23个任务。这些任务对大模型的推理、记忆、算法等能力提出了极高要求,堪称"模型杀手"。常被用来评判不同大模型的真正实力,在Prompt优化研究中受到格外关注。
一个测试模型语言理解灵活性的数据集,囊括了多个不同领域和形式的任务。任务类型包括分类、抽取、生成等,评判模型在不同场景下的适应能力。填补了现有基准测试中"大杂烩式"综合评估的空白,在Prompt研究中有独特价值。
这些数据集从不同侧面对Prompt方法进行了全方位考察。它们为Prompt研究树立了标杆:既有对通用能力的评估,如MMLU、BIG-bench;也有对专项能力的检验,如GSM8K之于数学推理、HellaSwag之于常识判断;还有对鲁棒性的挑战,如TruthfulQA、BBH等。对这些数据集的深入理解,也能帮助我们认清Prompt方法的优势和局限。比如,针对数学推理薄弱,可重点参考GSM8K、AQUA-RAT的结果;针对事实性判断不足,可着眼优化TruthfulQA的表现;而要突破极限、挑战自我,BBH则是不二之选。
1. Lambda:Anthropic公司的大语言模型,以安全性和对齐性著称。
以上就是这些模型的大致情况。这份Prompt研究所使用的模型主要分为三大类:大语言模型、多模态模型和视觉模型。
其中,大语言模型是目前的研究重点,从GPT-3到各种开源模型,无不在竞相追逐更大规模、更强能力;多模态模型则是Prompt未来的一个重要方向,通过对齐不同模态的语义表征,实现更自然、更灵活的人机交互;而视觉模型虽然与Prompt结合相对较少,但也在CLIP、Grounding DINO等工作中显示出了巨大潜力。
这些模型大多基于Transformer架构,或对其进行了改进创新。Transformer强大的并行计算和长程依赖捕获能力,使其成为驱动大模型发展的核心引擎。这也从另一个侧面反映了Prompt研究所依赖的技术根基。
当然,模型只是故事的一半,数据和算法同样不可或缺。类似BioBERT、FinBERT这样的针对特定领域的预训练,正是数据和模型结合的典范;而FLAN、CoCoOp等Prompt优化方法的提出,则为通用大模型的适配应用开辟了新路径。
作为Prompt的研究者和实践者,心怀敬畏和谦逊,认真学习这些先进技术,深刻领会其中的精髓,才是正途。识货不能光看表面功夫,底下的门道才是真功夫。如果对以上这些热门Prompt技术有所了解,自然就明白它们频频被引用的道理。某些自称专家的,怕是连个门都不知道在哪里,就跑出来现眼。希望这篇文章能帮大家擦亮眼睛。
对于Prompt开发者来说,多读论文、多跟进顶会、扎实功底才是关键。积累真本事,才配谈创新,才能不负众望地推动Prompt技术持续进步。
腾讯ima怎么把微信内容一键导入知识库?
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
比特币 2025 年价格预测:BTC 的未来走势
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
WorkBuddy微信版怎么获得积分?
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
男生高性价比充电头?
博世壁挂炉关闭暖气怎么操作
5000元起的鼠标哪个最值得入手?
车载冰箱重置到出厂设置几步?
短剧《史上最强洪荒修为》剧情介绍
管线机怎么接云米净水器
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
笔记本移动电源推荐哪款?
腾讯ima知识库怎么分类管理?
海尔消毒柜自动消毒如何中止
kimi提示词专家使用方法新手指南
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc