作者: Aman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan, Luyu Gao, Sarah Wiegreffe, Uri Alon, Nouha Dziri, Shrimai Prabhumoye, Yiming Yang, Sean Welleck, Bodhisattwa Prasad Majumder, Shashank Gupta, Amir Yazdanbakhsh, Peter Clark
提交日期: 2023年3月30日(v1)
与人类类似,大语言模型(LLMs)在首次尝试时并不总能针对给定的生成问题(例如摘要、回答、解释)生成最佳文本。正如人类会完善自己的文本一样,本文引入了 SELF-REFINE 框架,通过迭代反馈和优化来改进 LLM 的初始输出。其核心思想是:首先使用 LLM 生成一个输出,然后让同一模型为其自身输出提供多方面的反馈;最后,同一模型根据自身的反馈对其先前生成的输出进行优化。与早期工作不同,该迭代优化框架不需要监督训练数据或强化学习,且仅需使用单一的 LLM。作者在 7 个不同的任务上进行了实验,范围从评论重写到数学推理,证明该方法优于直接生成。在所有任务中,使用 SELF-REFINE 生成的输出在人类评估和自动化指标上均优于直接使用 GPT-3.5 和 GPT-4 生成的输出,平均绝对提升达 20%。