来源:互联网 更新时间:2026-08-02 13:21
这篇名为《LESS: Selecting Influential Data for Targeted Instruction Tuning》的论文,出自普林斯顿大学的陈丹琦团队。陈丹琦本人是清华姚班出身,斯坦福博士期间师从Christopher Manning,毕业后成为普林斯顿大学计算机学院助理教授。她在学期间已在ACL、EMNLP、NIPS等自然语言处理与机器学习顶级会议上发表过多篇论文。

LESS的核心思路是“优化器感知”——通过这种方式,从海量的指令数据集中,精准地挑选出5%最有价值的数据用于目标指令微调。实验结果显示,在多个下游任务上,用这些精选数据训练出的模型,表现往往比用完整数据集训出来的还要好。更厉害的是,LESS算法选出来的数据还有很强的迁移性:用小模型挑出来的数据,拿去训练更大的模型,效果依然出色,而且在不同系列的模型之间也通用。
整个流程可以分为四步,具体是怎么做到的呢?
首先,用LoRA(Low-rank Adaptation)技术对预训练的基础模型(比如LLAMA-2-7B)进行参数高效的微调。这样做的目的是大幅减少可训练参数的数量,从而加速训练过程。然后,在训练集的一个随机子集上进行N个epoch的预热训练,让模型适应特定的数据分布。每完成一个epoch,就保存一次模型检查点。
对于每一个训练数据点,计算它在预热训练期间产生的梯度。接着,应用随机投影技术(比如Johnson-Lindenstrauss引理)把这些高维的梯度压缩到低维空间,生成低维梯度特征。这些特征会被存储在一个梯度数据存储库中,后续的数据选择过程可以直接拿来用,效率很高。
对于目标任务的验证集(只需要少量示例就行),计算每个子任务的平均梯度特征。然后,通过LESS算法来评估每个训练数据点对验证集的潜在影响——具体做法是计算数据点的梯度特征与验证集特征之间的相似度,并据此打分。最后,根据得分高低,挑选出最高分的那部分训练数据(比如前5%),作为最终的训练集。
用选出来的这个数据子集去训练目标模型。这一步同样可以用LoRA做参数高效微调,也可以做完整微调。训练完成后,在测试集上评估模型性能,验证LESS选出的数据到底能带来多大的提升。
这套流程的根本逻辑,就是利用模型的梯度信息来估算每个数据点对目标任务的影响力,然后选出那些“高影响力”的数据进行针对性训练,从而提升模型在特定任务上的表现。LESS方法的关键在于,它能适配现有的优化器(比如Adam),同时还能有效处理可变长度的指令数据。另外,前面构建的梯度数据存储库可以重复用于不同的目标任务,大大提升了数据选择的效率。
实验结果对比了LESS与全量数据集(100%)、随机选择(5%)在不同模型、不同数据集下的表现。
几个关键结论值得关注:
这篇论文提出了一种基于优化器感知影响力的数据选择算法——LESS。它构建了一个高效且可重用的低维梯度特征存储库,使得数据选择过程变得非常高效。实验证明了LESS相比全量数据(100%)和随机数据(5%)的优势,同时也展示了用小模型挑选数据来训练大模型的潜力。分析和消融实验表明,LESS选出的数据在可解释性上更胜一筹,不过计算成本也确实不低。
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
Ondo将于今日上线股票永续合约
暗黑4S14野蛮人终局BD攻略
区块链OTC交易所有哪几家比较正规?
Binance新增15种bStocks代币化证券为杠杆抵押资产
Meme币DOGS今晚上线!开局就解锁91%代币是否带来风险?
忍者必须死3极刃血影角色介绍
晶核艾尔莎角色盘点 晶核艾尔莎强度分析与实战表现
余姚的路虎4s店在哪个位置
彩云天气怎么看分钟级降雨预报 彩云天气精准预报方法【技巧】
五千元以下的笔记本几乎消失!经销商:至少一年看不到涨价尽头
Intel喜讯连连:18A工艺良率提升到85%、CPU将涨价15%
遗忘之海密室通关教程 遗忘之海密室全关卡解谜思路与难点解析
华为Mate 70系列首发的红枫镜头下放至千元档:全员普及原色影像
合集38个项目筹集5.406亿美元 Figure融资2亿
国家养老服务消费补贴上线京东
英伟达机器人团队在京沪深招人,聚焦具身智能等四大领域
一站式PDF转Markdown解决方案PDF3MD
硬刚苹果!华为9月新品阵容出炉:Mate 90系列、全新三折叠
微软Copilot AI漏洞可致敏感数据泄露,企业用户需及时更新
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc