来源:互联网 更新时间:2026-08-21 14:36
今天继续分享一篇上周的热门论文——来自Meta、加州大学和纽约大学共同发表的《Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge》。没热点就发点干货,这篇挺有意思。

传统的大模型偏好对齐,离不开人工标注数据。而self-rewarding机制允许模型自己判断自己的回复质量,从而实现自我提升,不再依赖人工标注。这篇论文的核心贡献是提出了meta-rewarding机制,专门用来解决传统方法容易快速过拟合的问题,从而大幅提升模型的指令遵循能力。
初始状态下,模型已经有一个经过SFT的基础版,但没有监督数据。思路是通过迭代的自我对弈过程,从模型自身生成训练数据。在这个过程中,模型承担三个角色:作为actor,它对给定的prompt生成回复;作为judge,它对自己的回复进行评估和打分;作为meta-judge,它会比较自己判断的质量。
actor是最终需要的模型,但训练效果好不好,取决于judge的判断准不准。判断越准,为actor训练提供的反馈质量就越高,最终才能训练出更好的actor。所以meta-rewarding的目标是在训练过程中同时提升模型作为actor和judge的能力。meta-judge的作用就是提供训练judge所需的反馈信号。
通过meta-judge的评估,就能创建用于训练actor和judge的偏好对数据集。这里面既包括actor生成的response之间的偏好对,也包括judge判断之间的偏好对。
有了偏好数据集之后,使用DPO进行训练。下面给出meta-judge的prompt(翻译版):
Meta-Rewarding方法明显提升了模型遵循指令的能力。以Llama-3-8B-Instruct为例,在AlpacaEval 2上的胜率从22.9%提升到了39.4%。这个提升幅度相当可观。
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
腾讯ima怎么创建共享知识库?
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
WorkBuddy微信版怎么获得积分?
5000元起的鼠标哪个最值得入手?
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
车载冰箱重置到出厂设置几步?
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
腾讯ima知识库怎么分类管理?
短剧《仙人跳获透视,古玩玉器我全拿捏》剧情介绍
Windy卫星云图怎么看?云层变化识别技巧
Aptos(APT)2026-2032年价格预测与历史走势梳理
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc