热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Reference

Reference

来源:互联网 更新时间:2026-08-01 13:58

一般来说,大语言模型的训练可以分为三个阶段,下面这张图可以一目了然:

Reference

预训练(Pretraining)

:用海量文本数据,让模型学习基础的语言逻辑、常识和知识。

指令微调(Instruction Tuning)

:通过问答对,让模型学会回答人类问题、遵循指令。

RLHF(基于人类反馈的强化学习)

:借助人类或奖励模型的反馈,提升安全性等各方面能力。

今天先集中聊前两部分:预训练和指令微调。

预训练(Pretraining)

目前所有大模型的预训练都用的是同一个方法——语言建模(预测下一个字),所以决定预训练效果好坏的关键,其实就是数据。

预训练的数据主要涉及三个问题:数量要多少?质量怎么样?里面包含什么知识?

数据数量要多少?

2022年,Google DeepMind提出了Chinchilla最优方案,指出在相同计算量下,数据量和参数规模应该遵循一个特定比例才能训练出最佳模型,这就是大家常说的Chinchilla scaling law。
不过,这个最优比例是针对固定算力来说的。实际应用中算力虽然金贵,但我们总希望模型越强越好。所以Harm de Vries指出,可以“多花点算力,给模型喂更多数据”——这比死磕Chinchilla最优比例效果更好。直觉上,训练越久、数据越多,模型自然越好。目前预训练这块的共识还是数据越多越好,所以从LLaMA 1的1.4T tokens到LLaMA 2的2T tokens,趋势很明显。

数据质量如何?

数据质量是第二个关键点。传统数据科学领域一直在讲“Garbage in, Garbage out”,在大模型这里体现得尤为典型。最出名的是Falcon的作者,他们在论文里直接说:“我们是靠数据清理赢过LLaMA的”——虽然客观讲未必真的赢了,但处理流程确实下了功夫。
从他们公布的处理流程图能看到,从基础语言识别到各种去重,做了大量工作,目的就是让模型学到多样化且高质量的文本。对于预训练来说,数据质量始终是最重要的因素之一。

数据中蕴含的知识?

预训练阶段,如果你在训练数据里放入了不同领域的知识,模型就会学到对应的能力。我们来看看Falcon、MPT和LLaMA的预训练数据混合情况——
特意标出了它们各自包含多少比例的代码数据,从少到多依次是:Falcon < LLaMA < MPT。这个比例直接影响了下游任务的表现:编程能力的排序也完全一致——Falcon-7B < LLaMA-7B < MPT-7B。这是一个最直接的例子,说明不同的预训练数据配比会如何塑造模型的能力。

指令微调(Instruction Tuning)

指令微调的核心是让模型学会跟人对话,让人满意。如果一个模型只经过预训练而没有指令微调,最直接的结果就是它对每个问题都用“接龙”的方式往下续写——有时候会继续追问,有时候只回几个字就结束了,根本不做解释。
所以如何构建合适的指令微调数据集变得至关重要。这个环节同样要考虑两个点:数据多样性和数据质量。

数据多样性

Google在2022年提出的Flan2022指令微调数据集,包含了1836个不同的任务。这么多样化的数据集让模型学到了不同任务、不同问题的解决方法和回答方式。从实验也能看出,加入的任务越多,模型在下游任务上的表现就越好。
有意思的是,虽然Flan2022包含的任务非常多,但指令微调阶段的总训练token数跟预训练比起来简直是九牛一毛——大多在几十B tokens这个量级。

数据质量

数据质量这个问题,是LLaMA-2把它推到聚光灯下的。Meta还专门发了一篇论文来阐明:在指令微调阶段,质量比数量更重要,这就是《Lima: Less is more for alignment》。
Lima告诉我们:只用1000条高质量的指令微调数据,就能比很多训练更久的模型表现更好。这个结论相信很多从业者都听过,但真正会一行一行去看Lima数据集、理解所谓“高质量”到底好在哪里的人很少。
首先,多样性上Lima做得极其出色。光Stack Exchange这个部分(179道题)就包含了174种不同类型的问题,每一条都是完全不同的领域。其次,如果仔细看Lima里的每条数据,大多都具备三个特点:分步骤回答问题、提供详细解释、补充额外知识。这三个性质中的任何一个,都很难简单地用标签来定义。这里就不截图了,强烈推荐大家去Lima的数据集里一条一条翻翻看。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc