热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >AI大模型奖励优化之开源数据

AI大模型奖励优化之开源数据

来源:互联网 更新时间:2026-08-17 14:25

一、前言

在强化学习的棋局里,智能体的每一步行动,都绕不开一个核心的裁判——奖励模型。它就像一套精密的评分系统,决定了智能体如何从与环境的每一次互动中汲取经验,不断优化自己的策略,最终达成预设的目标。可以说,奖励模型的优劣,直接关系到智能体学习的成败。

AI大模型奖励优化之开源数据

二、奖励模型实现之开源数据

构建一个有效的奖励模型,通常离不开三个关键环节:数据收集、模型训练,以及至关重要的开源数据基础。接下来,我们就把焦点放在数据源头上,看看业界已经为我们准备了哪些宝贵的“燃料”。

2.1 开源数据

好消息是,针对奖励模型的训练,已经涌现出一些质量相当不错的开源数据集,可以直接取用。目前主流的几个,各具特色,也分别指向不同的任务场景。

先说OpenAI的布局。早在2020年,他们就将RLHF技术应用到了摘要生成任务上,并为此推出了

Summarize from Feedback

数据集。这套方法的逻辑很清晰:先利用人类对摘要好坏的评判数据训练出一个奖励模型,再用这个模型去指导最终的摘要生成模型向人类偏好靠拢。该数据集本身又分为两部分:

对比部分和轴向部分

  • 对比部分

    体量较大,约有17.9万条数据。它的标注方式很直接:给定一篇原文和两个生成的摘要,让标注者选出他们认为更好的那一个。
  • 轴向部分

    则包含了1.5万条数据,采用的是Likert量表进行评分,为摘要质量打上一个具体分数。需要注意一点,这两个部分的数据划分并不完全一致,对比部分只有训练集和验证集,而轴向部分则提供了测试集和验证集。

再看

WebGPT

项目。它的目标是提升模型在长文档问答上的能力,同样采用了人类反馈训练奖励模型的路径。该项目开放的数据集,包含了在项目结束时所有适用于奖励建模的对比数据,总计约1.9万条,为研究长文本任务的偏好对齐提供了资源。

另一个重量级的贡献来自Anthropic团队,即

HH-RLHF(Helpful and Harmless Reinforcement Learning from Human Feedback)数据集

。这个数据集主要包含两大块内容。

第一部分是关于“有用性”和“无害性”的人类偏好数据

第二部分则是红队测试对话

,由人类生成并进行标注。这部分数据非常宝贵,它像一张“攻击图谱”,能帮助我们洞察模型可能存在的脆弱点,弄清楚哪些提问或诱导方式更容易让模型“失守”,从而为提升模型的鲁棒性指明了方向。

最后是斯坦福大学开放的

Stanford Human Preferences(SHP)数据集

。它的规模相当可观,涵盖了38.5万条涉及18个不同领域(从烹饪到法律建议应有尽有)的问题和指令。每条数据都源自Reddit的一个帖子:帖子本身提出一个问题或指示,下面有两条高赞评论作为备选答案。数据构建时,通过点赞数等规则,自动将更受社区欢迎的评论标记为人类更偏好的回复。

这里有个很有趣的对比:

SHP和Anthropic的HH-RLHF数据集,其根本差异在于数据来源

。SHP中的内容完全是Reddit用户自然产生的真实互动,而HH-RLHF中的对话则主要由机器生成。这种来源上的根本不同,使得两者在内容风格、语言特点上形成了天然互补,为研究者提供了更丰富、更多元的视角。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc