来源:互联网 更新时间:2026-08-05 16:27
大语言模型(LLMs)在学术界和工业界已经遍地开花,从问答、摘要到对话、翻译,表现确实亮眼。但话说回来,现在主流的评估平台,基本都在盯着准确率这一项指标。这就像只看考试成绩,却忽略了学生答题时的“犹豫”和“不确定”。那么,模型的准确率高,真的就够了吗?这篇文章给我们提了个醒:不确定性,同样是评估大模型能力时不可绕过的关键维度。
为什么非要谈不确定性?因为现有的评估方法确实存在短板——只关注模型的预测结果对不对,却很少关心模型在给出这个结果时到底有多“有把握”。考虑到LLMs已经被用到各种高风险场景中,光看准确率显然是不够的。我们需要一个更全面的评估框架,既能看准不准,也能看稳不稳。
所以,这篇文章提出了一种新的基准测试方法,把不确定性量化整合了进来。具体来说,他们利用了“一致性预测”(Conformal Prediction)这个工具,不只是看模型答对了没有,还要看模型对自己的预测有多大信心。这样一来,评估就不再只是冷冰冰的分数,而是多了一层对模型“自知之明”的考察。通过对多个代表性任务中多个LLMs的实证研究,他们发现了规模、指令微调与不确定性之间的微妙关系,进一步点明了在评估LLMs时考虑不确定性的必要性。

文章提出的方法,核心思路是把不确定性量化问题转化为一个统计上的“预测集”问题。他们把五个典型的NLP任务都改造成了多项选择题的形式,并用了三种不同的提示策略来降低模型对提示方式的敏感度。接着,从模型那里拿到每个选项的预测概率,再用Softmax函数转成标准化的概率值。后续,通过一致性预测在校准集上计算出阈值,然后给测试集的每个样本生成一个包含多个候选答案的“预测集”。
在这个过程中,他们用到了两种一致性分数函数:最小歧义集值分类器(LAC)和自适应预测集(APS)。目的很明确——既要保证预测集尽可能包含正确答案,又要准确地反映出模型的不确定性。这种方法在统计上是严谨的,为评估LLMs提供了一个更立体的视角。



此外,文章还专门探索了MoE(混合专家)技术的影响。结果很不错,采用MoE的LLMs在准确性和不确定性两方面都优于未采用MoE的模型,说明MoE确实能提升模型处理复杂数据的适应能力。另一个有趣的发现是,即使校准数据的比例发生变化,一致性预测方法对不确定性的评估结果依然非常稳定,证明了这个方法相当鲁棒。最后,他们还把一致性预测和传统的困惑度(Perplexity)做了对比。结果很明显:一致性预测在覆盖率和不确定性评估上表现更稳定、更可靠。相比之下,困惑度在不同任务中的覆盖率波动很大,而一致性预测的覆盖率始终能保持在90%以上。这一对比,高下立判。
这篇文章通过一致性预测方法,对大模型的不确定性做了深入剖析。核心结论可以归纳为几点:LLMs虽然准确率高,但不确定性同样是评估中不可忽视的因素,甚至模型规模变大可能反而带来更高的不确定性;校准数据比例的变化对评估结果影响不大,说明方法很稳健;相比困惑度,一致性预测在不同任务中展现了更稳定的覆盖率和评估能力。这些发现给LLMs的综合评估提供了一个全新的视角,对于未来的研究和实际应用都很有指导意义。
[1] https://arxiv.org/pdf/2401.12794
Ondo将于今日上线股票永续合约
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
区块链OTC交易所有哪几家比较正规?
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
异环伊洛伊阵容怎么搭配
《探索流放之路物品等级的奥秘》 揭秘物品等级的效果和怎么查看
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
潜水员戴夫丛林DLC接吻的鱼任务攻略
电视剧《白领公寓》剧情介绍
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
电视剧《钟鼓楼》剧情介绍
Windows环境下Claude Code从C盘迁移至D盘的完整操作教程
AMD Zen6处理器跑分还再涨!同核心提升达35%
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
蚂蚁庄园答题今日答案2026年7月29日
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc