Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, Xian Li, Sainbayar Sukhbaatar, Jing Xu, Jason Weston
本文提出,要实现超人类智能体(superhuman agents),未来的模型需要超人类水平的反馈(superhuman feedback)来提供充分的训练信号。当前的方法通常基于人类偏好来训练奖励模型(reward models),这可能会受限于人类的表现水平;此外,这类独立的、冻结的奖励模型无法在 LLM 训练过程中自我改进。
在本工作中,作者研究了自我奖励语言模型(Self-Rewarding Language Models):在训练过程中,语言模型本身通过 LLM-as-a-Judge 的提示方式(prompting)来提供自己的奖励。实验表明,在迭代式 DPO(Iterative DPO) 训练过程中,不仅模型的指令跟随能力得到提升,其为自身提供高质量奖励的能力也随之增强。
通过将 Llama 2 70B 模型在该方法下进行三个迭代的微调,得到的模型在 AlpacaEval 2.0 排行榜上超越了多个现有系统,包括 Claude 2、Gemini Pro 和 GPT-4 0613。尽管仍有大量问题有待探索,该工作为模型在两个维度上持续自我改进的可能性打开了大门。