热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >通过10亿个人物角色扩展合成数据

通过10亿个人物角色扩展合成数据

来源:互联网 更新时间:2026-08-15 14:40

腾讯AI Lab的一项新研究引起了广泛关注。他们的核心成果是一个名为Persona Hub的角色库,以及一套基于角色的数据合成方法。这项工作的意义,得从头说起。

一、结论写在前面

下面介绍的论文来自腾讯AI Lab,核心思路是利用庞大的角色库来驱动合成数据的生成。

论文标题

:Scaling Synthetic Data Creation with 1,000,000,000 Personas

论文的背景

  • 合成数据在训练大型语言模型(LLMs)中正变得越来越重要。
  • 现有的数据合成方法各有短板:实例驱动的方法受限于种子语料库的规模;关键点驱动的方法又很难构建一套全面且详尽的关键点列表。总之,想大规模、多样化地创建合成数据,一直是个难题。

论文的方法

  • 提出了一种新颖的人物角色驱动数据合成方法:核心是利用LLM中多样的视角来创造多样化的合成数据。简单说,就是在数据合成的提示里加入一个“人物角色”,引导LLM生成该角色视角下的独特内容。
  • 构建了Persona Hub:一个包含10亿个多样化人物角色的集合。这些角色从网络数据中自动筛选和构建而来,覆盖了全球约13%的人口,可以看作是一种分布式的世界知识载体。
  • 数据合成流程:通过“文本到角色”(Text-to-Persona)和“角色到角色”(Persona-to-Persona)两种方法扩展角色集合;再使用零样本或少样本提示,让LLM生成多样化的指令和内容;此外,通过迭代扩展人物关系,进一步丰富了角色库。

论文的效果

  • 多功能性:成功应用于数学和逻辑推理问题、用户指令、知识丰富文本、游戏NPC和工具功能等多个领域。
  • 性能提升:在MATH数据集上,一个7B参数的模型达到了64.9%的准确率,这个成绩仅次于某些GPT-4变体。
  • 可扩展性和多样性:能够大规模创建多样化的合成数据,覆盖广泛的主题和视角。
  • 灵活性和易用性:可以轻松适应不同的场景和需求,比如指令调优、预训练和后训练等。
  • 潜在影响:有望推动合成数据创建和应用的范式转变,对LLM的研究、开发和应用产生深远影响。

二、论文的简单介绍

图1:角色可以与各种数据合成提示(例如,创建一个数学问题或用户提示)协同工作,引导LLM从相应视角合成数据。角色中心中的10亿角色能够以亿级规模促进各种数据合成场景的合成数据创建

2.1 论文的背景

随着合成数据在训练大型语言模型(LLMs)中日益受到重视,人们也越来越热衷于让LLM生成所需的数据:只需要给一个数据合成提示,就期望它能产出理想的合成数据。然而,大规模创建合成数据,说起来容易做起来难。虽然我们可以轻松地扩大合成数据的数量,但要让它的多样性也同步跟上,就没那么简单了。如果不考虑多样化的采样,给定一个数据合成提示,LLM只能生成1个实例。因此,想要大规模创建多样化的合成数据(比如10亿个不同的数学问题),就需要有大量多样化的提示。

之前的研究主要通过两种范式来多样化数据合成提示,但遗憾的是,两者都无法实现可扩展的合成数据创建:

• 实例驱动:这种方法通过利用种子语料库来使数据合成提示多样化。但问题在于,合成数据的多样性主要来自种子实例,难以真正超越种子语料库。考虑到大多数实际场景中种子语料库的规模有限,这种范式很难扩大合成数据的创建。

• 关键点驱动:这种方法通过精心策划的全面关键点(或概念)列表来使数据合成提示多样化。然而,这种方法在实践中也面临困难:除非限定在狭窄且特定的领域(如数学),否则很难通过枚举不同粒度级别的所有关键点来策划一个全面的列表。

为了实现大规模、多样化的合成数据创建,该团队提出了一种新颖的基于人物角色的数据合成方法。这个想法源于一个观察:仅仅在数据合成提示中添加一个人物角色,就能引导LLM朝相应的视角创建独特的合成数据,如图1所示。由于几乎任何LLM用例都可以与特定的人物角色相关联,只要构建一个全面的人物角色集合,就可以大规模创建包罗万象的合成数据。

图2:从压缩的角度来看,Persona Hub可以被视为将世界知识(用于训练LLMs的公共网络文本)压缩成分布式载体的形式。另一方面,公共网络文本可以被看作是这些角色以其知识和经验创造的解压内容。

为了促进以角色为驱动的数据合成研究,该团队首先从Persona Hub中发布了200,000个角色,并随后发布了使用各种角色创建的合成数据样本,包括:

  • 50,000道数学题
  • 50,000道逻辑推理题
  • 50,000条指令
  • 10,000篇知识丰富的文本
  • 1,000个游戏NPC角色 * 5,000种工具(功能)

2.2 角色库(Persona Hub)

该团队提出了两种可扩展的方法,从大量网络数据中衍生出多样化的角色,以构建角色库:文本到角色(Text-to-Persona)和角色到角色(Persona-to-Persona)。

2.2.1 文本到角色(Text-to-Persona)

具有特定专业经历和文化背景的人会有独特的阅读和写作兴趣。因此,从特定文本中,可以推断出一个可能阅读、喜欢该文本的特定角色。鉴于网络上的文本数据几乎是无限的且包罗万象的,只需通过这些网络文本提示LLM,就能获得广泛的角色集合,如图3所示。

存在多种格式(例如,纯文本或结构化文本)来表示一个角色,这些格式可以在提示中进行控制。输出角色描述的粒度也可以通过提示进行调整。例如,粗粒度的角色可能是“一位计算机科学家”,而细粒度的角色则是“专注于神经网络架构和注意力机制的机器学习研究人员”。在实践中,该团队要求LLM输出的角色描述应尽可能具体。除了在提示中指定角色描述的粒度外,输入文本也可以影响角色描述的粒度。如图4所示,如果输入文本包含许多详细元素,生成的角色描述也将是具体且细致的。因此,通过将Text-to-Persona方法应用于大规模网络文本数据,可以获得数十亿(甚至数万亿)种多样化的角色,涵盖不同粒度的广泛方面。

图3:Text-to-Persona方法:通过向LLM提问“谁可能阅读这段文字?”,可以使用任何文本作为输入来获取相应的角色

图4:如果输入文本涉及许多详细元素,角色描述将更加细致

2.2.2 Persona-to-Persona

Text-to-Persona是一种高度可扩展的方法,可以合成几乎涵盖每个方面的角色。然而,它可能仍会遗漏一些在网络上可见度较低的角色,例如儿童、乞丐或电影幕后工作人员。为了补充这些角色,该团队提出了Persona-to-Persona方法,从通过Text-to-Persona获得的角色中推导出具有人际关系的角色。如图5所示,“一个孩子”的角色可以从儿童医院护士的角色衍生出来;“一个乞丐”可以从避难所工作人员的角色衍生出来;“一个幕后电影工作人员”可以从电影主演的角色衍生出来。根据六度分离理论,该团队对通过文本到人物角色方法获得的每个人物角色进行六次迭代的人物关系扩展,从而进一步丰富了角色集合。

图5:人物角色到人物角色方法通过人际关系获得多样化的人物角色,这可以通过向LLM提问“谁与给定人物角色有密切关系?”来轻松实现

2.2.3 去重

该团队首先在RedPajama v2数据集上运行Text-to-Persona,然后执行Persona-to-Persona。在获得数十亿个人物角色后,不可避免地会有一些角色是相同或极其相似的。为了确保角色库的多样性,团队通过两种方式对这些角色进行去重:

基于MinHash的去重

:使用MinHash根据角色描述的n-gram特征进行去重。由于角色描述通常只有1-2句话,团队简单地使用了1-gram和128的签名大小进行MinHash去重,并在相似度阈值为0.9的情况下进行去重。

基于嵌入的去重

:在基于表面形式去重之后,还采用了基于嵌入的去重方法。使用文本嵌入模型(例如OpenAI的text-embedding-3-small模型)为每个人物角色计算一个嵌入,然后过滤掉余弦语义相似度大于0.9的角色。需要注意的是,尽管团队选择0.9作为阈值,但可以根据具体需求灵活调整。例如,当对实例数量的要求不高但对多样性的要求较高时,可以应用更严格的去重标准。

经过去重处理并采用简单的启发式方法过滤掉低质量的人物描述后,团队总共收集了1,015,863,523个人物角色,最终形成了Persona Hub。

2.3 基于人物角色的合成数据生成

团队提出的基于人物角色的数据合成方法简单而有效,其核心在于将一个人物角色融入到数据合成的提示语中的适当位置。尽管方法看似简单,却能显著引导LLM采用该人物角色的视角来生成合成数据。依托于Persona Hub中10亿级的人物角色,该方法能够轻松地以亿级规模生成多样化的合成数据。

图6:零样本、少样本和角色增强少样本提示方法

正如可以使用零样本或少样本方法来提示LLM,角色驱动的方法同样灵活且兼容多种形式的提示,以创建合成数据。如图6所示,团队提出了三种角色驱动的数据合成提示方法:

  • 零样本提示

    :不利用任何现有示例,从而充分发挥模型的创造力,不受特定示例的限制。
  • 少样本提示

    :通过提供一些演示,能更好地确保合成数据符合要求。
  • 角色增强少样本提示

    :在增强LLM的角色驱动数据合成能力方面更为有效。但其缺点是需要为每个演示推导出相应的角色。

2.4 应用案例

团队展示了Persona Hub在多种数据合成场景中的应用案例,包括大规模创建数学和逻辑推理问题、指令(即用户提示)、知识丰富的文本、游戏NPC以及工具(函数)开发。如前所述,角色驱动的方法具有普遍性和多功能性,只需调整数据合成提示,即可轻松适应不同的数据合成场景。因此,团队仅对数学问题合成进行详细的技术讨论,而对其他应用案例则不作详细讨论。

2.4.1 数学问题

2.4.1.1 演示

如图1所示,当提示LLM创建数学问题时,添加一个角色会使LLM创建与该角色相关的数学问题。图7(左)中的示例进一步证实了这一点:当呈现语言学家角色时,LLM将在计算语言学的背景下创建数学问题。此外,添加角色并不会阻碍提示的灵活性——仍然可以轻松地在提示中指定所需数学问题的焦点(图7中间)或难度(图7右边)。

图7:一个语言学家角色,针对不同数学问题创建提示,指定焦点(例如几何)或难度(例如奥林匹克级别)

图8:使用与数学领域相关的专业人士角色创建的数学问题示例。这些问题通常比使用通用角色创建的问题更具挑战性,因为它们通常需要对高级数学知识和技能有更深入和更细致的理解

图7中的示例展示了使用通用角色创建数学问题的方法。当然也可以利用与数学相关的专业人士来创建数学问题。如图8所示,数学专业人士的角色通常涉及更高级和细粒度的数学知识和技能,这使得创建的数学问题能够涵盖这些数学概念,从而更具挑战性。

2.4.1.2 评估

数据

:团队从Persona Hub中选取了109万个角色,并使用GPT-4的零样本提示方法,利用这些角色创建数学问题,在创建过程中不借鉴MATH等基准中的任何实例。这种方法合成了109万个数学问题。由于本工作侧重于创建新的合成数据而非合成解决方案,团队仅使用gpt-4o为创建的问题生成解决方案。在这109万个数学问题中,团队随机抽取2万个作为合成测试集以方便评估。剩余的107万个问题用于训练。

测试集

:团队使用以下两个测试集进行评估:

  • 合成测试集(同分布)

    :这2万个保留的问题集与107万个训练实例的生成方式相同,因此可以视为同分布测试集。为了确保该测试集中答案的准确性,团队额外使用gpt-4o和gpt-4-turbo生成解决方案,并保留至少有两个解决方案一致的测试实例。剩余的测试集包含11.6万个测试实例。
  • 数学(MATH Out-of-distribution)

    :最广泛认可的用于测试LLMs数学推理能力的基准。其测试集包含5,000道具有参考答案的竞赛级数学问题。由于团队未使用MATH数据集中的任何实例进行数据合成或训练,因此将MATH测试集视为外分布测试集。

等式检查

:团队遵循与OpenAI相同的评估协议,在MATH基准上进行答案等式检查。对于合成测试集,采用类似方法,区别在于使用Llama-3-70B-Instruct而非gpt-4-turbo-preview作为等式检查器。

团队仅对最新的开源7B LLM——Qwen2-7B进行微调,使用合成的107万个数学问题,并在上述两个测试集上评估其贪心解码输出。

表1:在11.6K合成测试实例上的内分布评估结果

表2:MATH的分布外评估。使用合成的1.07M数学问题微调的模型在MATH上达到64.9%,与仅7B规模的gpt-4-turbo-preview性能相当*

表1展示了在11.6K合成测试实例上的分布内(ID)评估结果。在测试的开源LLMs中,Qwen2-72B-Instruct取得了最佳结果,其他模型的排名通常与其在其他数学基准上的报告性能一致。实验中的模型,借助1.07M合成数学问题,达到了近80%的准确率,超过了所有开源LLMs。不过,考虑到合成测试中的答案并非绝对可靠,并且实验中的模型可能是唯一使用ID训练数据的模型,因此这些ID评估结果应仅作为参考。

表2展示了在MATH数据集上的评估结果。使用合成训练数据微调的7B模型仅通过贪婪解码就在MATH上取得了令人印象深刻的64.9%的准确率,只有gpt-4o、gpt-4-turbo等模型能够超越它。

图9:在MATH数据集上,通过缩放用于训练Qwen2-7B的合成实例的准确性

图9展示了模型在不同规模的合成数学问题训练下的MATH数据集表现。其性能趋势大体符合缩放定律。与先前研究在分布内数据上进行缩放不同,实验在数据合成或训练过程中未使用任何MATH实例。因此,在这种分布外(OOD)评估设置下,超越gpt-4-turbo-preview(1106/0125)的表现对于一个7B模型来说确实令人印象深刻且充满希望。

团队检验了合成的数学问题的质量:从200个挑战性问题中抽样(涉及中国高中和大学水平的数学知识点),并由腾讯AI实验室的两位数学专家评估这些问题的有效性。仅有7个问题被标记为无效,得出一个可靠的有效率96.5%。

图10:不同相似度人格生成的数学问题的相似性:(a)无特定焦点时数学问题的相似性;(b)提示指定必须与财务和概率相关时数学问题的相似性;(c)相似度为0.9的人格合成的gpt-4o和gpt-35-turbo生成的数学问题的相似性

此外,团队特别考察了提示中人格差异对合成数学问题的影响。采样了100对语义相似度分别为0.4、0.6和0.8的人格。对于每一对人格,使用它们通过贪心解码生成一对数学问题。然后计算这些数学问题对的语义相似性。结果清楚地显示,合成数学问题之间的语义相似度往往与对应角色之间的相似度相关,但通常较低。当向提示中添加更多特定约束(例如,关于金融和概率的数学问题)时,合成数学问题之间的相似度往往会增加。团队还测试了使用高度相似角色(相似度=0.9)创建的gpt-4o和gpt-35-turbo生成的数学问题的相似度。结果表明,gpt-4o和gpt-35-turbo生成的数学问题的语义相似度似乎没有显著差异:大多数合成数学问题的相似度落在0.6到0.75的范围内,远低于角色之间的相似度(0.9)。基于这些观察,可以相信使用Persona Hub中的角色可以确保合成数据的多样性——即使在十亿规模上。

2.4.2 逻辑推理问题

与数学问题类似,逻辑推理问题也可以轻松合成。图11展示了使用角色驱动方法合成的典型逻辑推理问题示例。此外,图12还展示了使用角色创建的几个“弱智吧风格”的逻辑推理问题。所有示例都表明,只要清楚地描述要创建的逻辑推理问题的要求,就可以使用各种角色引导LLM生成多样化的逻辑推理问题,这些问题不仅满足要求,而且与角色高度相关,即使是异想天开的“弱智吧风格”问题也不例外。

2.4.3 指令

LLMs的最终用户是人类。可以使用Persona Hub来模拟各种用户,以了解他们对LLM协助的典型请求,从而生成多样化的指令(即用户提示)。图13展示了两个典型的基于人物角色的提示,用于合成指令,分别对应零样本提示和人物角色增强的少样本提示方法。零样本方法不依赖任何现有的指令数据集,允许LLM根据不同的人物角色生成各种指令。相比之下,人物角色增强的少样本方法需要现有的指令数据集来采样一些指令作为示范,并通过文本到人物角色方法推断这些指令的相关人物角色。虽然这种方法更复杂,但它产生的合成指令更接近真实用户的指令。

使用Persona Hub创建的多样化指令,通常代表用户与LLM对话的第一轮,可以轻松使用LLM生成后续的对话轮次,从而产生大量模拟的用户-LLM对话,这将有助于增强LLM的指令遵循和对话能力。此外,甚至可以采用类似的方法,从Persona Hub中选择两个人物角色,让LLMs扮演这两个角色,从而模拟两个真实人物之间的对话。

2.4.4 知识丰富的文本

除了合成可以增强LLMs指令微调的指令外,基于人物角色的方法还可以轻松适应创建有利于LLMs预训练和后训练的知识丰富的普通文本。如图14所示,可以提示LLM使用从Persona Hub中抽样的人物角色来撰写一篇Quora文章。这种方法能引出LLM相应的知识和观点,从而产生高度信息化和知识丰富的内容。通过利用Persona Hub中的10亿个人物角色来扩大这一过程,可以轻松获得大量知识丰富的文本,几乎涵盖了各种粒度级别的任何主题。

2.4.5 游戏NPC

Persona Hub的一个直接且实用的应用是创建多样化的NPC(非玩家角色),适用于游戏的大规模生产。只要能够向LLM提供游戏的背景和世界构建信息,就可以提示LLM将Persona Hub中的角色(通常是现实世界的角色)投影到游戏世界中的角色。这样,可以显著减少游戏设计过程中构思NPC所需的努力。

图15和16展示了具体的例子,团队使用Persona Hub中的人物角色为游戏“魔兽世界”和“天涯明月刀”创建游戏NPC。

2.4.6 工具(功能)开发

Persona Hub可用于模拟广泛的实际用户,以预测他们对LLM的可能请求(即指令)。类似地,可以使用Persona Hub来预测用户可能需要的工具,以便预先构建这些工具(功能)。当真实用户提出类似请求时,LLM可以直接调用这些预构建的工具返回结果,而无需每次都从头开始构建工具。这种由Persona Hub引入的范式是一种全新的解决方案,它能让LLMs更好地服务用户。可以预见,随着LLMs变得更加大众化和多功能化,这种方法在未来将具有巨大的潜力。

图17展示了使用各种角色创建的工具示例。这些工具提供了角色可能需要但无法通过LLM直接访问的功能,极大地扩展了LLM提供的服务范围。需要注意的是,尽管图17中的工具仅是接口定义,但这些定义可以轻松转换为代码实现,如图18所示。生成的预构建工具随后可以直接被LLM在未来使用,无需每次从头开始构建。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc