热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Loss 才是涌现的关键,而非模型参数

Loss 才是涌现的关键,而非模型参数

来源:互联网 更新时间:2026-08-05 16:25

大语言模型的涌现能力,一直是这个领域里最让人着迷的话题之一。大家普遍认为,随着模型参数规模的不断膨胀,一些“高级”能力会像魔法一样突然出现。但实际情况远比这复杂。一方面,人们发现小模型有时候也能在“涌现”能力上表现不俗;另一方面,用来衡量这些能力的指标本身,往往存在非线性或不连续的陷阱。

为了把这个问题真正搞清楚,我们从头训练了30多个不同参数规模和数据量的语言模型,并在12个英文和中文数据集上进行了评估。结果发现,一个更朴素的规律浮出水面:所谓的“涌现”,与模型是否跨过某个

预训练损失(Pre-training Loss)

的阈值密切相关。

基于这些观察,我们认为“涌现能力”的定义应该回归本源——只有当预训练损失低于某个临界值时,才能说模型真正具备了该能力。

论文链接:https://arxiv.org/abs/2403.15796

1. 数据集

我们研究了语言模型在12个下游任务上的表现与Pre-training Loss之间的关系。实验中评估的英文和中文数据集见下表。(图片位置)

2. Pre-training Loss vs 性能

第一个实验很直接:我们训练了三个参数量分别为1.5B、6B和32B的模型,然后跟踪它们在训练过程中每个checkpoint的损失值与下游任务表现。

结果非常有启发性,如下图所示:

图:1.5B、6B和32B模型的性能与损失曲线。每个数据点代表三个模型之一的中间 checkpoint 的损失(x轴)和性能(y轴)。我们用黑色虚线标记随机猜测的结果。
  • 一个清晰的趋势:随着训练损失的降低,任务性能普遍提升,这与模型大小无关。在MMLU、C-Eval、GSM8K和GSM8K-Chinese这几个任务上,三个不同大小的模型在预训练损失降至约

    2.2

    之前,表现都和随机猜测没区别;而一旦跨过这个门槛,性能就开始稳步爬升。
  • 更关键的是,不同模型大小的“性能-损失”数据点,竟然高度重叠在同一条趋势曲线上。换句话说,如果你只看数据点,根本分不清哪个点是1.5B模型的,哪个是32B模型的。比如,当训练损失降到约2.00时,TriviaQA上的绿色和橙色点已经完全混在一起了。这再清楚不过地表明:下游任务性能的关键锚点是

    预训练损失

    ,而不是模型参数量本身。
  • 有意思的是,无论是在中文还是英文任务上,整体训练损失(overall training loss)都是一个稳定且有效的预测指标。这或许意味着,在多语言预训练过程中,中英文token的学习动态其实高度相似。

3. Tokens vs 性能

模型参数不是关键,那训练数据量(tokens)呢?为了回答这个问题,我们又用不同数量的tokens,训练了28个相对较小的模型。

结果如下图所示:

  • 和上一个实验如出一辙:不同模型大小和不同训练tokens量所产生的数据点,几乎都落在同一条趋势曲线上。换句话说,无论你用了多少tokens、模型有多大,只要最终的预训练损失相同,那它在12个下游任务上的表现就会高度一致。
  • 当然,在MMLU、C-Eval、GSM8K和GSM8K-Chinese这几个任务上,性能曲线仍然没有出现明显的上升——这意味着这些模型的损失还远没有跌到“涌现”所需的阈值。

为了验证这些发现是否具备普遍性,我们还顺手拿LLAMA系列模型做了同样的分析,结果基本一致。

4. 涌现 vs 连续性指标

关于涌现能力,有一种颇具影响力的观点认为,它不过是研究者选择了

非线性或不连续指标

而产生的错觉。针对这个争议,我们在MMLU和C-Eval上用三种不同指标进行了对比实验:Accuracy(非连续指标)、CorrectChoiceProb(连续性指标)和BrierScore(另一种连续的评估量)。

实验结果如下图所示:

结论很清楚:无论是非连续指标还是连续性指标,当预训练损失逼近转折点时,涌现能力都会出现。连续性指标并没有消除那个清晰的临界点。所以,“涌现只是指标幻觉”这个说法,至少在预训练损失的视角下是站不住脚的。

5. 不足

任何研究都有其边界,我们也不例外。

首先,我们没有系统性地考察不同的模型架构和训练算法。虽然我们在自己的模型和LLAMA系列上验证了结论,但如果换成其他架构,结果未必能平移。

其次,以预训练损失作为核心观察指标,本身也存在短板:损失值深受分词器和预训练语料库分布的影响。在不同语料上训练的模型,它们的损失值并不直接可比。一个可能的改进方向是:在公共验证集上进行评估,并用归一化的困惑度来消除词汇量和分布偏差。

最后,我们这篇文章的目的,并不是鼓励大家盲目地推出参数更大、数据更多的模型。我们无法保证在更大规模上不会出现新的转折点。更重要的是,预训练并非提升涌现能力的唯一途径——指令微调等方法,同样可以显著提升模型在未知任务上的零样本表现。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc