热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >数据增强框架 LLM2LLM

数据增强框架 LLM2LLM

来源:互联网 更新时间:2026-07-31 13:21

一、结论写在前面

这篇论文的核心贡献,是提出了一套名为LLM2LLM的自适应、迭代式数据增强框架。它利用大语言模型(LLM)本身来扩充微调数据集,而不是靠人工手动收集更多样本——这听起来有点“用魔法打败魔法”的意思。结果呢?在低资源场景下,LLM2LLM能用远少于传统方法所需的真实数据量,达到甚至超越手工收集更多数据的表现。为什么有效?关键在于它的迭代和针对性:框架会盯着那些模型容易出错的数据点,专门在那里“加料”,让信号更强、更精准。

二、论文的简单介绍

2.1 论文的背景

微调要想效果好,离不开足够多的训练数据。可在很多实际应用中,能拿到的特定任务数据就那么一丁点。收集、清洗、标注额外数据,成本和时间都是天文数字。所以问题来了:怎么才能把手头这点有限的数据,变得足够支撑起一次成功的微调?

数据增强是个老办法,在NLP领域,人们常用同义词替换、字符替换(比如故意拼错)、随机交换、回译等技巧。但效果嘛,只能说“聊胜于无”。

最近,有些研究开始尝试用LLM来生成微调数据,效果比传统方法好不少。不过,这些方法通常是对所有可用训练数据无差别地做增强,完全不考虑LLM在单个数据点上的预测准确性。观察一下就知道:对于算术、阅读理解这类推理任务,LLM能轻松搞定简单题,但遇到难题就容易翻车。如果继续在那些模型已经拿高分的数据点上做增强,那就等于白费力气——边际收益极低。

2.2 论文的方法

假设我们有一个预训练好的大模型M(比如GPT-3.5或LLaMA2-7B),目标是用一个小种子数据集D把它微调适配到一个新领域——例如具有特定术语的医疗数据,或带特有特征的私有数据库。这种情况下,零样本或普通微调的效果往往不尽人意。虽然已经有few-shot学习等策略,但这里严格聚焦于:如何用LLM来丰富给定的目标数据集D。这个方法与现有技术是正交的,可以叠加使用。

需要特别说明的是,LLM2LLM不等于知识蒸馏。知识蒸馏通常假设教师模型在目标数据上精度很高,但这里的情况恰恰相反:教师模型在目标数据上可能也表现不佳(比如缺乏领域知识)。不过,只要教师模型具备足够的推理能力,能在给定提示和答案后生成概念相似但语义不同的示例,LLM2LLM就能发挥作用。

2.2.1 LLM2LLM

整个框架的端到端算法如算法1所示。受Self-Instruct启发,我们用教师模型Mteacher,专门针对学生模型在训练期间预测错误的数据点生成合成数据——相当于“哪里不会补哪里”。具体来说:先在目标数据集D₀上训练一个基线学生模型Mstudent,评估性能;然后过滤出学生模型答错的训练示例(记为Ei);接着提示教师模型创建概念一致但语义不同的额外数据点(具体提示见附录B.4)。教师模型不一定非得更大,关键是要能推理、能按指令做数据增强,还能生成与错误示例相似的样本。整个过程在图1中有示意说明。

2.3 论文的效果

2.3.1 实验设置

为了评估效果,论文把LLM2LLM用在了LLaMA2-7B的微调上,测试数据集包括GSM8K、CaseHOLD、SNIPS、TREC和SST-2。这些数据集分别按0.02%到50%不等的比例进行子采样,模拟不同的低资源场景。教师模型则考虑了GPT-3.5、GPT-4-Turbo、LLaMA2-70B和Airoboros-L2-70B。另外还做了额外实验,确保教师模型生成的增强数据与评估精度的测试集不重叠,避免数据泄露问题。

2.3.2 主要结果

先说最核心的结果:用GPT-3.5当教师,在GSM8K上微调LLaMA2-7B,不同训练数据量下的表现。然后扩展到其他数据集(见表1)。

经过10次LLM2LLM迭代后,最终精度如表1所示。在极低资源下——只有74个示例(GSM8K训练集的1%)——普通微调的测试精度仅为0.99%。但LLM2LLM通过基于错误数据点迭代生成391个额外示例,将精度拉升到19.56%。如果把种子数据增加到149个(训练集的2%),精度能达到25.70%。对比一下:用普通微调,需要10倍以上的训练数据才能匹配这个成绩(表2)。

图2还展示了在GSM8K和CaseHOLD上,基线精度如何随着每次应用LLM2LLM而提升。可以清楚看到,前几次迭代中精度增长尤其迅猛,尤其是在低资源场景下。

2.3.3 与其他增强方法的比较

表2将LLM2LLM与EDA、AugGPT以及其他从未见训练集添加更多数据的方式做了对比。在GSM8K上,LLM2LLM比普通微调高出20个百分点以上,比EDA高8%以上,比AugGPT高5%以上;在CaseHOLD上,LLM2LLM比微调基线高约35%,比EDA高2.3%,比AugGPT高1.1%。这些提升主要归功于LLM2LLM能针对模型薄弱环节生成更精准的示例,而AugGPT只是无差别增强,效率自然低了一截。

2.3.4 教师模型的选择

前面都用GPT-3.5当教师,换成其他LLM会怎样?预期是:越强的教师,质量越高,精度越高。表A.1印证了这一点:在GSM8K上,74个种子示例时,用LLaMA2-70B只能到11.8%,用Airoboros到15.0%,而GPT-4-Turbo达到了19.8%。这很合理——GPT-4-Turbo在数学推理上的能力公认更强,大致与GPT-4相当。

2.3.5 消融研究

这里有几组消融实验,用来验证LLM2LLM中各个设计决策的合理性。

2.3.5.1 迭代增强 vs. 一次性增强

先看迭代增强是不是比一次性添加所有增强数据更有效。在GSM8K和CaseHOLD上,将经过10次迭代增强达成的最终精度,与一次性添加等量增强数据的结果做对比(表3)。结果很明显:在GSM8K上,每个示例经过10步迭代,每步增强一个数据点,比一次性增强五个数据点的精度高7.4%;CaseHOLD上,10步迭代(每步一个)比一次性增强四个数据点高4.6%。这证明了迭代、逐步增强的策略是更优的。

2.3.5.2 使用种子数据 vs. 增强数据做增强

每次迭代中,LLM2LLM只在原始种子数据集上评估学生模型,并从错误的种子示例生成增强数据。那么,如果把种子数据和之前迭代产生的增强数据都拿来做评估和生成,结果会怎样?表4显示,后者往往性能更差,且总增强数据点过多。例如在GSM8K上,从上一轮增强数据里再生成,精度只有18.3%,而一直用种子数据做进一步增强则能达到23.75%。原因正如3.1节讨论的:使用增强数据做进一步增强容易偏离原始数据分布。

2.3.5.3 从头微调 vs. 连续微调

另一个关键选择:每次迭代是从上一次的检查点继续微调(连续微调),还是每次都从预训练模型重新开始(从头微调)?考虑到优化目标的非凸性和复杂的损失景观,答案并不显而易见。但表5的数据很直接:从头微调始终显著优于连续微调,精度差距最高达9%。连续微调表现差,很可能是因为在多次迭代中,尤其是低资源情况下种子数据太少,模型过度拟合了那点小的种子数据。而每次从头微调,把增强数据附加到种子数据中构成新训练集,有效缓解了这个问题。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc