来源:互联网 更新时间:2026-08-05 16:25
大语言模型的涌现能力,一直是这个领域里最让人着迷的话题之一。大家普遍认为,随着模型参数规模的不断膨胀,一些“高级”能力会像魔法一样突然出现。但实际情况远比这复杂。一方面,人们发现小模型有时候也能在“涌现”能力上表现不俗;另一方面,用来衡量这些能力的指标本身,往往存在非线性或不连续的陷阱。
为了把这个问题真正搞清楚,我们从头训练了30多个不同参数规模和数据量的语言模型,并在12个英文和中文数据集上进行了评估。结果发现,一个更朴素的规律浮出水面:所谓的“涌现”,与模型是否跨过某个
基于这些观察,我们认为“涌现能力”的定义应该回归本源——只有当预训练损失低于某个临界值时,才能说模型真正具备了该能力。
论文链接:https://arxiv.org/abs/2403.15796我们研究了语言模型在12个下游任务上的表现与Pre-training Loss之间的关系。实验中评估的英文和中文数据集见下表。(图片位置)
第一个实验很直接:我们训练了三个参数量分别为1.5B、6B和32B的模型,然后跟踪它们在训练过程中每个checkpoint的损失值与下游任务表现。
结果非常有启发性,如下图所示:
图:1.5B、6B和32B模型的性能与损失曲线。每个数据点代表三个模型之一的中间 checkpoint 的损失(x轴)和性能(y轴)。我们用黑色虚线标记随机猜测的结果。模型参数不是关键,那训练数据量(tokens)呢?为了回答这个问题,我们又用不同数量的tokens,训练了28个相对较小的模型。
结果如下图所示:
为了验证这些发现是否具备普遍性,我们还顺手拿LLAMA系列模型做了同样的分析,结果基本一致。
关于涌现能力,有一种颇具影响力的观点认为,它不过是研究者选择了
实验结果如下图所示:
结论很清楚:无论是非连续指标还是连续性指标,当预训练损失逼近转折点时,涌现能力都会出现。连续性指标并没有消除那个清晰的临界点。所以,“涌现只是指标幻觉”这个说法,至少在预训练损失的视角下是站不住脚的。
任何研究都有其边界,我们也不例外。
首先,我们没有系统性地考察不同的模型架构和训练算法。虽然我们在自己的模型和LLAMA系列上验证了结论,但如果换成其他架构,结果未必能平移。
其次,以预训练损失作为核心观察指标,本身也存在短板:损失值深受分词器和预训练语料库分布的影响。在不同语料上训练的模型,它们的损失值并不直接可比。一个可能的改进方向是:在公共验证集上进行评估,并用归一化的困惑度来消除词汇量和分布偏差。
最后,我们这篇文章的目的,并不是鼓励大家盲目地推出参数更大、数据更多的模型。我们无法保证在更大规模上不会出现新的转折点。更重要的是,预训练并非提升涌现能力的唯一途径——指令微调等方法,同样可以显著提升模型在未知任务上的零样本表现。
Ondo将于今日上线股票永续合约
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
区块链OTC交易所有哪几家比较正规?
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
合集38个项目筹集5.406亿美元 Figure融资2亿
AMD英特尔集体失眠!英伟达Rosa CPU搭载Rigel核:单核性能碾压x86
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
macOS 28将移除Rosetta 2兼容层,Intel应用面临运行危机
新破天一剑太极刀任务攻略 破天一剑怎么取太极刀
潜水员戴夫丛林DLC接吻的鱼任务攻略
电视剧《白领公寓》剧情介绍
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
电视剧《钟鼓楼》剧情介绍
Windows环境下Claude Code从C盘迁移至D盘的完整操作教程
AMD Zen6处理器跑分还再涨!同核心提升达35%
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc