热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >探索大语言模型的不确定性评估

探索大语言模型的不确定性评估

来源:互联网 更新时间:2026-08-05 16:27

单位 |

Tencent AI Lab; University College London; University of Macau

研究方向 |

大模型评测

论文标题 |

Benchmarking LLMs via Uncertainty Quantification

论文地址 |

https://arxiv.org/pdf/2401.12794

代码地址 |

https://github.com/smartyfh/LLM-Uncertainty-Bench


洞见

大语言模型(LLMs)在学术界和工业界已经遍地开花,从问答、摘要到对话、翻译,表现确实亮眼。但话说回来,现在主流的评估平台,基本都在盯着准确率这一项指标。这就像只看考试成绩,却忽略了学生答题时的“犹豫”和“不确定”。那么,模型的准确率高,真的就够了吗?这篇文章给我们提了个醒:不确定性,同样是评估大模型能力时不可绕过的关键维度。

1. 工作动机

为什么非要谈不确定性?因为现有的评估方法确实存在短板——只关注模型的预测结果对不对,却很少关心模型在给出这个结果时到底有多“有把握”。考虑到LLMs已经被用到各种高风险场景中,光看准确率显然是不够的。我们需要一个更全面的评估框架,既能看准不准,也能看稳不稳。

所以,这篇文章提出了一种新的基准测试方法,把不确定性量化整合了进来。具体来说,他们利用了“一致性预测”(Conformal Prediction)这个工具,不只是看模型答对了没有,还要看模型对自己的预测有多大信心。这样一来,评估就不再只是冷冰冰的分数,而是多了一层对模型“自知之明”的考察。通过对多个代表性任务中多个LLMs的实证研究,他们发现了规模、指令微调与不确定性之间的微妙关系,进一步点明了在评估LLMs时考虑不确定性的必要性。

2. 实验方法

文章提出的方法,核心思路是把不确定性量化问题转化为一个统计上的“预测集”问题。他们把五个典型的NLP任务都改造成了多项选择题的形式,并用了三种不同的提示策略来降低模型对提示方式的敏感度。接着,从模型那里拿到每个选项的预测概率,再用Softmax函数转成标准化的概率值。后续,通过一致性预测在校准集上计算出阈值,然后给测试集的每个样本生成一个包含多个候选答案的“预测集”。

在这个过程中,他们用到了两种一致性分数函数:最小歧义集值分类器(LAC)和自适应预测集(APS)。目的很明确——既要保证预测集尽可能包含正确答案,又要准确地反映出模型的不确定性。这种方法在统计上是严谨的,为评估LLMs提供了一个更立体的视角。

3. 实验结果

实验设置

  • 错误率与数据划分

    :将错误率设定为0.1,确保预测集以至少90%的概率包含真实标签。数据集被划分为50%的校准集和50%的测试集。
  • 示例和输入长度

    :遵循上下文学习(In-Context Learning)的范式,实验中都包含了示例,并对所有任务设定了2048个令牌的最大输入长度限制。
  • 评估指标与提示策略

    :使用准确率、预测集大小和覆盖率作为核心指标,配合三种不同的提示策略以及两种一致性分数函数(LAC和APS)来量化不确定性。

实验结果

不确定性与准确性的关系:

Table 2的实验结果很有意思:那些准确率更高的LLMs,不确定性反而可能更大。这直接说明了一个问题——准确率并不是评价模型的唯一标准,不确定性这个维度必须被纳入考量。

模型规模对不确定性的影响:

图3的结果揭示了一个反直觉的现象:更大规模的LLMs,相比小模型,反而可能表现出更大的不确定性。模型越大,并不代表它就越“自信”。

指令微调对不确定性的影响:

通过对比基础预训练模型和微调后的模型,研究还发现,指令微调倾向于增加LLMs的不确定性,尤其是在需要遵循复杂指令完成任务时。

此外,文章还专门探索了MoE(混合专家)技术的影响。结果很不错,采用MoE的LLMs在准确性和不确定性两方面都优于未采用MoE的模型,说明MoE确实能提升模型处理复杂数据的适应能力。另一个有趣的发现是,即使校准数据的比例发生变化,一致性预测方法对不确定性的评估结果依然非常稳定,证明了这个方法相当鲁棒。最后,他们还把一致性预测和传统的困惑度(Perplexity)做了对比。结果很明显:一致性预测在覆盖率和不确定性评估上表现更稳定、更可靠。相比之下,困惑度在不同任务中的覆盖率波动很大,而一致性预测的覆盖率始终能保持在90%以上。这一对比,高下立判。

5. Take Away

这篇文章通过一致性预测方法,对大模型的不确定性做了深入剖析。核心结论可以归纳为几点:LLMs虽然准确率高,但不确定性同样是评估中不可忽视的因素,甚至模型规模变大可能反而带来更高的不确定性;校准数据比例的变化对评估结果影响不大,说明方法很稳健;相比困惑度,一致性预测在不同任务中展现了更稳定的覆盖率和评估能力。这些发现给LLMs的综合评估提供了一个全新的视角,对于未来的研究和实际应用都很有指导意义。

[1] https://arxiv.org/pdf/2401.12794

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc