来源:互联网 更新时间:2026-07-28 15:11
大语言模型(LLMs)对提示内容异常敏感,而文本任务指令本身又常常带着歧义——这两件事凑在一起,就成了实践中绕不开的难题。怎么让模型发挥出最佳性能?自动提示工程(Auto-Prompt)就变得很关键。
今天要聊的这篇文章,提出了一套叫Intent-based Prompt Calibration (IPC) 的系统。直白点说,它想通过合成案例样本来优化大模型的提示工程。
https://arxiv.org/pdf/2402.03099v1.pdf
这几年,大语言模型的能力确实突飞猛进,在各类任务上成绩亮眼。但有一个老问题始终没变:模型输出的质量对提示条件太敏感了。哪怕只是格式上稍微改一下,性能就可能大幅波动。这个问题在专有领域模型上尤其明显——一旦模型版本更新,生成结果可能面目全非。
有人想到用软提示(soft-prompt)来解决,但这类方法需要动到模型内部结构才能优化,成本不低。最近的研究另辟蹊径:让大模型自己来优化提示。具体做法是,先给每个提示打个分,再通过一个元提示(meta-prompt)把最近几次的分数整合起来,引导模型选出得分更高的提示。听起来不错,但这种方法需要大量高质量基准数据来评估——而这类数据并不好找。
好在大语言模型本身已经被证明能够生成高质量、内容丰富的数据集,用来提升模型在多样化任务上的表现。近期的研究也展示了模型细化用户提示、消除初始歧义的能力。问题是,如果缺乏额外信息,模型只能猜测用户的真实意图,而这个猜测在很多情况下并不准确。
基于这些背景,本文提出了基于意图的提示校准(IPC)系统。它的设计思路是:通过合成示例,根据用户的意图来校准提示。校准过程会迭代地构建一批有挑战性的样本数据集,然后基于这些基准数据逐步优化提示。
IPC的整体系统架构由四个核心模块组成:
其中:
IPC的具体流程如下:
作者从初始提示建议和任务描述开始。用户还可以在少量样本的设置中提供一些示例。在校准优化过程中,系统会迭代执行以下步骤:
此外,IPC的基线配置针对分类任务做了专门优化:将准确度设定为评分函数,并通过混淆矩阵和提示错误分类进行错误分析。整体流程示例如下:
从图中可以看到,每次迭代中,系统都会根据当前提示生成新样本,然后利用这些样本的误分类信息来细化提示,直到提示能够校准到用户的真实意图。
下图展示了在Spoiler和PG分类任务上的准确率对比。IPC在所有测试方法中表现最佳,且方差较低——这意味着它的稳定性也更好。
下图展示了情感分类任务中,不同训练步骤下合成数据集上的准确率。同样,IPC在所有测试方法中表现最佳,方差也最低。
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
Ondo将于今日上线股票永续合约
电视剧《罗曼诺夫后裔》剧情介绍
暗黑4S14野蛮人终局BD攻略
《三角洲行动》S10赛季卡邮件技巧详解-三种方法及风险提示
如何在火狐浏览器中彻底禁用自动更新功能?
区块链OTC交易所有哪几家比较正规?
手机qq浏览器误删文件如何找回-手机qq浏览器误删除文件怎样恢复
360浏览器如何设置网页缩放比例
《三角洲行动》GTI超人成就解锁攻略-满辐射状态击杀技巧详解
全链网:戴蒙或继续担任摩根大通首席执行官三年
什么是山寨币?山寨币指数如何查看?全球前10大山寨币盘点
Binance新增15种bStocks代币化证券为杠杆抵押资产
Sophon正在关闭其Layer2区块链并迁移到Base
全球十大加密货币APP v3.11.5正版下载
异环1.2前瞻什么时候
《三角洲行动》ASh-12战斗步枪改装攻略-省钱与击杀方案详解
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc