来源:互联网 更新时间:2026-08-15 14:40
腾讯AI Lab的一项新研究引起了广泛关注。他们的核心成果是一个名为Persona Hub的角色库,以及一套基于角色的数据合成方法。这项工作的意义,得从头说起。
下面介绍的论文来自腾讯AI Lab,核心思路是利用庞大的角色库来驱动合成数据的生成。
图1:角色可以与各种数据合成提示(例如,创建一个数学问题或用户提示)协同工作,引导LLM从相应视角合成数据。角色中心中的10亿角色能够以亿级规模促进各种数据合成场景的合成数据创建
随着合成数据在训练大型语言模型(LLMs)中日益受到重视,人们也越来越热衷于让LLM生成所需的数据:只需要给一个数据合成提示,就期望它能产出理想的合成数据。然而,大规模创建合成数据,说起来容易做起来难。虽然我们可以轻松地扩大合成数据的数量,但要让它的多样性也同步跟上,就没那么简单了。如果不考虑多样化的采样,给定一个数据合成提示,LLM只能生成1个实例。因此,想要大规模创建多样化的合成数据(比如10亿个不同的数学问题),就需要有大量多样化的提示。
之前的研究主要通过两种范式来多样化数据合成提示,但遗憾的是,两者都无法实现可扩展的合成数据创建:
• 实例驱动:这种方法通过利用种子语料库来使数据合成提示多样化。但问题在于,合成数据的多样性主要来自种子实例,难以真正超越种子语料库。考虑到大多数实际场景中种子语料库的规模有限,这种范式很难扩大合成数据的创建。
• 关键点驱动:这种方法通过精心策划的全面关键点(或概念)列表来使数据合成提示多样化。然而,这种方法在实践中也面临困难:除非限定在狭窄且特定的领域(如数学),否则很难通过枚举不同粒度级别的所有关键点来策划一个全面的列表。
为了实现大规模、多样化的合成数据创建,该团队提出了一种新颖的基于人物角色的数据合成方法。这个想法源于一个观察:仅仅在数据合成提示中添加一个人物角色,就能引导LLM朝相应的视角创建独特的合成数据,如图1所示。由于几乎任何LLM用例都可以与特定的人物角色相关联,只要构建一个全面的人物角色集合,就可以大规模创建包罗万象的合成数据。
图2:从压缩的角度来看,Persona Hub可以被视为将世界知识(用于训练LLMs的公共网络文本)压缩成分布式载体的形式。另一方面,公共网络文本可以被看作是这些角色以其知识和经验创造的解压内容。
为了促进以角色为驱动的数据合成研究,该团队首先从Persona Hub中发布了200,000个角色,并随后发布了使用各种角色创建的合成数据样本,包括:
该团队提出了两种可扩展的方法,从大量网络数据中衍生出多样化的角色,以构建角色库:文本到角色(Text-to-Persona)和角色到角色(Persona-to-Persona)。
具有特定专业经历和文化背景的人会有独特的阅读和写作兴趣。因此,从特定文本中,可以推断出一个可能阅读、喜欢该文本的特定角色。鉴于网络上的文本数据几乎是无限的且包罗万象的,只需通过这些网络文本提示LLM,就能获得广泛的角色集合,如图3所示。
存在多种格式(例如,纯文本或结构化文本)来表示一个角色,这些格式可以在提示中进行控制。输出角色描述的粒度也可以通过提示进行调整。例如,粗粒度的角色可能是“一位计算机科学家”,而细粒度的角色则是“专注于神经网络架构和注意力机制的机器学习研究人员”。在实践中,该团队要求LLM输出的角色描述应尽可能具体。除了在提示中指定角色描述的粒度外,输入文本也可以影响角色描述的粒度。如图4所示,如果输入文本包含许多详细元素,生成的角色描述也将是具体且细致的。因此,通过将Text-to-Persona方法应用于大规模网络文本数据,可以获得数十亿(甚至数万亿)种多样化的角色,涵盖不同粒度的广泛方面。
图3:Text-to-Persona方法:通过向LLM提问“谁可能阅读这段文字?”,可以使用任何文本作为输入来获取相应的角色
图4:如果输入文本涉及许多详细元素,角色描述将更加细致
Text-to-Persona是一种高度可扩展的方法,可以合成几乎涵盖每个方面的角色。然而,它可能仍会遗漏一些在网络上可见度较低的角色,例如儿童、乞丐或电影幕后工作人员。为了补充这些角色,该团队提出了Persona-to-Persona方法,从通过Text-to-Persona获得的角色中推导出具有人际关系的角色。如图5所示,“一个孩子”的角色可以从儿童医院护士的角色衍生出来;“一个乞丐”可以从避难所工作人员的角色衍生出来;“一个幕后电影工作人员”可以从电影主演的角色衍生出来。根据六度分离理论,该团队对通过文本到人物角色方法获得的每个人物角色进行六次迭代的人物关系扩展,从而进一步丰富了角色集合。
图5:人物角色到人物角色方法通过人际关系获得多样化的人物角色,这可以通过向LLM提问“谁与给定人物角色有密切关系?”来轻松实现
该团队首先在RedPajama v2数据集上运行Text-to-Persona,然后执行Persona-to-Persona。在获得数十亿个人物角色后,不可避免地会有一些角色是相同或极其相似的。为了确保角色库的多样性,团队通过两种方式对这些角色进行去重:
经过去重处理并采用简单的启发式方法过滤掉低质量的人物描述后,团队总共收集了1,015,863,523个人物角色,最终形成了Persona Hub。
团队提出的基于人物角色的数据合成方法简单而有效,其核心在于将一个人物角色融入到数据合成的提示语中的适当位置。尽管方法看似简单,却能显著引导LLM采用该人物角色的视角来生成合成数据。依托于Persona Hub中10亿级的人物角色,该方法能够轻松地以亿级规模生成多样化的合成数据。
图6:零样本、少样本和角色增强少样本提示方法
正如可以使用零样本或少样本方法来提示LLM,角色驱动的方法同样灵活且兼容多种形式的提示,以创建合成数据。如图6所示,团队提出了三种角色驱动的数据合成提示方法:
团队展示了Persona Hub在多种数据合成场景中的应用案例,包括大规模创建数学和逻辑推理问题、指令(即用户提示)、知识丰富的文本、游戏NPC以及工具(函数)开发。如前所述,角色驱动的方法具有普遍性和多功能性,只需调整数据合成提示,即可轻松适应不同的数据合成场景。因此,团队仅对数学问题合成进行详细的技术讨论,而对其他应用案例则不作详细讨论。
如图1所示,当提示LLM创建数学问题时,添加一个角色会使LLM创建与该角色相关的数学问题。图7(左)中的示例进一步证实了这一点:当呈现语言学家角色时,LLM将在计算语言学的背景下创建数学问题。此外,添加角色并不会阻碍提示的灵活性——仍然可以轻松地在提示中指定所需数学问题的焦点(图7中间)或难度(图7右边)。
图7:一个语言学家角色,针对不同数学问题创建提示,指定焦点(例如几何)或难度(例如奥林匹克级别)
图8:使用与数学领域相关的专业人士角色创建的数学问题示例。这些问题通常比使用通用角色创建的问题更具挑战性,因为它们通常需要对高级数学知识和技能有更深入和更细致的理解
图7中的示例展示了使用通用角色创建数学问题的方法。当然也可以利用与数学相关的专业人士来创建数学问题。如图8所示,数学专业人士的角色通常涉及更高级和细粒度的数学知识和技能,这使得创建的数学问题能够涵盖这些数学概念,从而更具挑战性。
团队仅对最新的开源7B LLM——Qwen2-7B进行微调,使用合成的107万个数学问题,并在上述两个测试集上评估其贪心解码输出。
表1:在11.6K合成测试实例上的内分布评估结果
表2:MATH的分布外评估。使用合成的1.07M数学问题微调的模型在MATH上达到64.9%,与仅7B规模的gpt-4-turbo-preview性能相当*
表1展示了在11.6K合成测试实例上的分布内(ID)评估结果。在测试的开源LLMs中,Qwen2-72B-Instruct取得了最佳结果,其他模型的排名通常与其在其他数学基准上的报告性能一致。实验中的模型,借助1.07M合成数学问题,达到了近80%的准确率,超过了所有开源LLMs。不过,考虑到合成测试中的答案并非绝对可靠,并且实验中的模型可能是唯一使用ID训练数据的模型,因此这些ID评估结果应仅作为参考。
表2展示了在MATH数据集上的评估结果。使用合成训练数据微调的7B模型仅通过贪婪解码就在MATH上取得了令人印象深刻的64.9%的准确率,只有gpt-4o、gpt-4-turbo等模型能够超越它。
图9:在MATH数据集上,通过缩放用于训练Qwen2-7B的合成实例的准确性
图9展示了模型在不同规模的合成数学问题训练下的MATH数据集表现。其性能趋势大体符合缩放定律。与先前研究在分布内数据上进行缩放不同,实验在数据合成或训练过程中未使用任何MATH实例。因此,在这种分布外(OOD)评估设置下,超越gpt-4-turbo-preview(1106/0125)的表现对于一个7B模型来说确实令人印象深刻且充满希望。
团队检验了合成的数学问题的质量:从200个挑战性问题中抽样(涉及中国高中和大学水平的数学知识点),并由腾讯AI实验室的两位数学专家评估这些问题的有效性。仅有7个问题被标记为无效,得出一个可靠的有效率96.5%。
图10:不同相似度人格生成的数学问题的相似性:(a)无特定焦点时数学问题的相似性;(b)提示指定必须与财务和概率相关时数学问题的相似性;(c)相似度为0.9的人格合成的gpt-4o和gpt-35-turbo生成的数学问题的相似性
此外,团队特别考察了提示中人格差异对合成数学问题的影响。采样了100对语义相似度分别为0.4、0.6和0.8的人格。对于每一对人格,使用它们通过贪心解码生成一对数学问题。然后计算这些数学问题对的语义相似性。结果清楚地显示,合成数学问题之间的语义相似度往往与对应角色之间的相似度相关,但通常较低。当向提示中添加更多特定约束(例如,关于金融和概率的数学问题)时,合成数学问题之间的相似度往往会增加。团队还测试了使用高度相似角色(相似度=0.9)创建的gpt-4o和gpt-35-turbo生成的数学问题的相似度。结果表明,gpt-4o和gpt-35-turbo生成的数学问题的语义相似度似乎没有显著差异:大多数合成数学问题的相似度落在0.6到0.75的范围内,远低于角色之间的相似度(0.9)。基于这些观察,可以相信使用Persona Hub中的角色可以确保合成数据的多样性——即使在十亿规模上。
与数学问题类似,逻辑推理问题也可以轻松合成。图11展示了使用角色驱动方法合成的典型逻辑推理问题示例。此外,图12还展示了使用角色创建的几个“弱智吧风格”的逻辑推理问题。所有示例都表明,只要清楚地描述要创建的逻辑推理问题的要求,就可以使用各种角色引导LLM生成多样化的逻辑推理问题,这些问题不仅满足要求,而且与角色高度相关,即使是异想天开的“弱智吧风格”问题也不例外。
LLMs的最终用户是人类。可以使用Persona Hub来模拟各种用户,以了解他们对LLM协助的典型请求,从而生成多样化的指令(即用户提示)。图13展示了两个典型的基于人物角色的提示,用于合成指令,分别对应零样本提示和人物角色增强的少样本提示方法。零样本方法不依赖任何现有的指令数据集,允许LLM根据不同的人物角色生成各种指令。相比之下,人物角色增强的少样本方法需要现有的指令数据集来采样一些指令作为示范,并通过文本到人物角色方法推断这些指令的相关人物角色。虽然这种方法更复杂,但它产生的合成指令更接近真实用户的指令。
使用Persona Hub创建的多样化指令,通常代表用户与LLM对话的第一轮,可以轻松使用LLM生成后续的对话轮次,从而产生大量模拟的用户-LLM对话,这将有助于增强LLM的指令遵循和对话能力。此外,甚至可以采用类似的方法,从Persona Hub中选择两个人物角色,让LLMs扮演这两个角色,从而模拟两个真实人物之间的对话。
除了合成可以增强LLMs指令微调的指令外,基于人物角色的方法还可以轻松适应创建有利于LLMs预训练和后训练的知识丰富的普通文本。如图14所示,可以提示LLM使用从Persona Hub中抽样的人物角色来撰写一篇Quora文章。这种方法能引出LLM相应的知识和观点,从而产生高度信息化和知识丰富的内容。通过利用Persona Hub中的10亿个人物角色来扩大这一过程,可以轻松获得大量知识丰富的文本,几乎涵盖了各种粒度级别的任何主题。
Persona Hub的一个直接且实用的应用是创建多样化的NPC(非玩家角色),适用于游戏的大规模生产。只要能够向LLM提供游戏的背景和世界构建信息,就可以提示LLM将Persona Hub中的角色(通常是现实世界的角色)投影到游戏世界中的角色。这样,可以显著减少游戏设计过程中构思NPC所需的努力。
图15和16展示了具体的例子,团队使用Persona Hub中的人物角色为游戏“魔兽世界”和“天涯明月刀”创建游戏NPC。
Persona Hub可用于模拟广泛的实际用户,以预测他们对LLM的可能请求(即指令)。类似地,可以使用Persona Hub来预测用户可能需要的工具,以便预先构建这些工具(功能)。当真实用户提出类似请求时,LLM可以直接调用这些预构建的工具返回结果,而无需每次都从头开始构建工具。这种由Persona Hub引入的范式是一种全新的解决方案,它能让LLMs更好地服务用户。可以预见,随着LLMs变得更加大众化和多功能化,这种方法在未来将具有巨大的潜力。
图17展示了使用各种角色创建的工具示例。这些工具提供了角色可能需要但无法通过LLM直接访问的功能,极大地扩展了LLM提供的服务范围。需要注意的是,尽管图17中的工具仅是接口定义,但这些定义可以轻松转换为代码实现,如图18所示。生成的预构建工具随后可以直接被LLM在未来使用,无需每次从头开始构建。
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
2026鸣潮账号交易安全指南:五大交易平台对比与风险避坑分析
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
Windy卫星云图怎么看?云层变化识别技巧
9条破亿视频,新号涨粉百万,过去半年谁在制造AI爆款?
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
如何修复Edge浏览器无法通过微软账号进行身份验证?
原神霜月三处月灵龛具体位置汇总
五菱星光L六座新能源SUV上市:三版可选,中配12.28
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc