来源:互联网 更新时间:2026-08-18 13:56
大型语言模型在预训练阶段,怎么选数据、怎么配比例,一直是个让人头疼的问题。数据混合比例的好坏,直接关系到能不能用更少的token、更低的loss来加速预训练进程。手动去调各个数据源的配比,不仅难以扩展,而且大概率不是最优解。
今天我们来聊聊一个挺巧妙的方法——
Paper: https://arxiv.org/abs/2407.01492
Github: https://github.com/sail-sg/regmix

他们用这个方法,训练了512个参数只有1M的小模型,拟合出回归模型后,筛选出top64的混合比例,然后用这些比例去训练一个1B参数的模型。结果很直观:最优配比下训练的模型,验证集loss就是最低的。

整个流程其实不复杂。首先,生成一堆随机的数据混合比例,用这些比例采样数据来训练小模型。然后,把这些混合比例当作特征,模型训练的目标值当作标签,拿去拟合一个回归模型。接下来,在更大的数据混合比例空间中,用这个回归模型去预测哪个比例能拿到最佳目标值。最后一步,就是用这个模拟出来的最佳比例,去训练真正的大模型。
训练小模型当然是多多益善,但考虑到成本,得控制次数。所以初始化比例的时候,既要保证多样性,也要确保每个数据领域都有极端值出现。具体采样时,他们是基于token分布,采用狄利克雷分布来生成混合比例的。
详见:mixture_config/synthesize_mixture.py
至于回归模型的选择,他们试了
实验用的是Pile数据集中不涉及版权的17个子集,具体组成如下表。

一个关键发现是:用512个1M小模型(在1B token上训练)拟合出的回归模型,与直接在25B token数据上训练出来的1B模型进行排序对比,相关性高达97.12%。这意味着小模型的排序结果,已经能非常准确地预示大模型的表现趋势。

这里有个细节值得注意:训练

另一个值得关注的点是,数据混合比例对下游任务的影响相当显著。比如在Lambada数据集上,最好和最差的配比,效果能差出14.6%。

有意思的是,实验结果还挑战了一个传统认知。过去我们总觉得维基百科数据质量高,是评估LLM最具代表性的数据集。但实验发现,

最后,RegMix还能帮我们发现不同领域数据之间复杂的交互作用。这些相互作用,光靠人类固有的经验,是很难直接看出来的。

腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
2026鸣潮账号交易安全指南:五大交易平台对比与风险避坑分析
腾讯ima怎么创建共享知识库?
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
2026年三角洲行动账号交易指南:5大交易平台对比与安全选购建议
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
Windy卫星云图怎么看?云层变化识别技巧
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
网络热词我黑切呢是什么意思
五菱星光L六座新能源SUV上市:三版可选,中配12.28
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc