热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >Meta-Rewarding:LLM对齐新技术

Meta-Rewarding:LLM对齐新技术

来源:互联网 更新时间:2026-08-21 14:36

今天继续分享一篇上周的热门论文——来自Meta、加州大学和纽约大学共同发表的《Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge》。没热点就发点干货,这篇挺有意思。

Meta-Rewarding:LLM对齐新技术

背景

传统的大模型偏好对齐,离不开人工标注数据。而self-rewarding机制允许模型自己判断自己的回复质量,从而实现自我提升,不再依赖人工标注。这篇论文的核心贡献是提出了meta-rewarding机制,专门用来解决传统方法容易快速过拟合的问题,从而大幅提升模型的指令遵循能力。

初始状态下,模型已经有一个经过SFT的基础版,但没有监督数据。思路是通过迭代的自我对弈过程,从模型自身生成训练数据。在这个过程中,模型承担三个角色:作为actor,它对给定的prompt生成回复;作为judge,它对自己的回复进行评估和打分;作为meta-judge,它会比较自己判断的质量。

actor是最终需要的模型,但训练效果好不好,取决于judge的判断准不准。判断越准,为actor训练提供的反馈质量就越高,最终才能训练出更好的actor。所以meta-rewarding的目标是在训练过程中同时提升模型作为actor和judge的能力。meta-judge的作用就是提供训练judge所需的反馈信号。

迭代训练方案

  • actor数据创建:生成多个response。
  • judge数据创建:judge对每个response进行评估并生成评分。
  • meta-judge评估:meta-judge比较judge生成的评分,确定哪个更准确。

偏好对数据集

通过meta-judge的评估,就能创建用于训练actor和judge的偏好对数据集。这里面既包括actor生成的response之间的偏好对,也包括judge判断之间的偏好对。

有了偏好数据集之后,使用DPO进行训练。下面给出meta-judge的prompt(翻译版):

效果

Meta-Rewarding方法明显提升了模型遵循指令的能力。以Llama-3-8B-Instruct为例,在AlpacaEval 2上的胜率从22.9%提升到了39.4%。这个提升幅度相当可观。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc