热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >探讨大模型预训练与微调之间的相互作用

探讨大模型预训练与微调之间的相互作用

来源:互联网 更新时间:2026-08-23 13:58

有几个问题一直困扰着大模型的研究者和实践者:预训练过程中模型性能到底是怎么演变的?预训练步数越多,下游微调效果就越好吗?微调到底让模型学到了什么,又丢失了什么?

Paper: https://arxiv.org/abs/2408.06663

目前开源的模型中,完整放出所有中间checkpoints的并不多,再加上实验成本高昂,本文的分析主要基于OLMo-1B模型——它的训练细节、预训练数据和微调数据都是公开的。微调数据的具体配置如下表所示。

大模型在预训练过程中的性能如何变化?

研究人员对预训练过程中不同阶段的checkpoints做了下游任务的zero-shot和few-shot测试,结果如上图。一个值得注意的现象是:随着训练步数增加,并非所有任务的表现都会同步提升。部分任务在整个预训练周期里基本没什么变化;而那些效果有所提升的任务,也主要集中在训练早期,到了后期就趋于平稳了。

模型在预训练中更多是在学习知识——但即便学得更多,可能仍然不会用。

更多步数的预训练对下游微调有何影响?

上图揭示了一个有意思的规律:如果某个任务在预训练阶段已经表现不错,那么微调并不会带来进一步的提升——知识其实已经学到了,微调帮不上忙。

但那些在预训练阶段表现不佳的任务,微调会带来明显的改善。而且微调收益通常呈现先增加后减少的趋势。

因此,如果某个任务必须依赖下游微调,那么选用预训练中早停的checkpoint效果往往更好。

大模型微调学到了什么,又忘记了什么?

可以从三个维度来剖析微调的效果:任务格式、任务迁移和领域知识。

  • 任务格式

    :用三种任务格式(默认格式、IO格式、Instruct格式)分别测试不同checkpoint的性能。结果发现:在预训练早期,微调格式与预训练格式越一致,效果越好;但随着预训练步数增加,模型对格式的敏感性逐步下降,变得更加灵活。微调阶段恰恰可以帮助模型适应不同的任务格式。

  • 任务迁移

    :已有不少研究指出,微调能改进某些任务但会损害另一些。实验表明:在生成任务上微调,对其他生成任务和分类任务几乎没负面影响;但在分类任务上微调,虽然对其他分类任务无碍,却会明显拖累生成任务的表现。

  • 领域知识

    :模型在学会新能力之后,是否一定会遗忘之前掌握的领域知识?下图给出了不一致的答案:所有NLI数据在MNLI上微调后,效果都得到了提升;但在PAWS上微调后,其他释义检测数据集的表现反而下降了。这说明遗忘与学习是同时发生的。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc