OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2401.10020

Self-Rewarding Language Models:让模型用自奖励持续提升能力

 
  accident ·  2026-08-25 11:01:33 · 2 次点击  · 0 条评论  

自我奖励语言模型(Self-Rewarding Language Models)

作者

Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, Xian Li, Sainbayar Sukhbaatar, Jing Xu, Jason Weston

摘要

本文提出,要实现超人类智能体(superhuman agents),未来的模型需要超人类水平的反馈(superhuman feedback)来提供充分的训练信号。当前的方法通常基于人类偏好来训练奖励模型(reward models),这可能会受限于人类的表现水平;此外,这类独立的、冻结的奖励模型无法在 LLM 训练过程中自我改进。

在本工作中,作者研究了自我奖励语言模型(Self-Rewarding Language Models):在训练过程中,语言模型本身通过 LLM-as-a-Judge 的提示方式(prompting)来提供自己的奖励。实验表明,在迭代式 DPO(Iterative DPO) 训练过程中,不仅模型的指令跟随能力得到提升,其为自身提供高质量奖励的能力也随之增强。

通过将 Llama 2 70B 模型在该方法下进行三个迭代的微调,得到的模型在 AlpacaEval 2.0 排行榜上超越了多个现有系统,包括 Claude 2、Gemini Pro 和 GPT-4 0613。尽管仍有大量问题有待探索,该工作为模型在两个维度上持续自我改进的可能性打开了大门。

主题/分类

  • 主要分类:计算与语言(Computation and Language, cs.CL)
  • 相关分类:人工智能(Artificial Intelligence, cs.AI)

其他信息

  • 会议:ICML 2024
  • 提交时间:2024年1月18日(v1),最新修订于2025年3月28日(v3)
  • arXiv 编号:2401.10020
2 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 23 ms
Developed with Cursor