OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2303.17651v1

Self-Refine:通过自反馈迭代提升大语言模型输出质量

 
  blind ·  2026-07-29 11:01:15 · 9 次点击  · 0 条评论  

Self-Refine: Iterative Refinement with Self-Feedback

作者: Aman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan, Luyu Gao, Sarah Wiegreffe, Uri Alon, Nouha Dziri, Shrimai Prabhumoye, Yiming Yang, Sean Welleck, Bodhisattwa Prasad Majumder, Shashank Gupta, Amir Yazdanbakhsh, Peter Clark

提交日期: 2023年3月30日(v1)

摘要

与人类类似,大语言模型(LLMs)在首次尝试时并不总能针对给定的生成问题(例如摘要、回答、解释)生成最佳文本。正如人类会完善自己的文本一样,本文引入了 SELF-REFINE 框架,通过迭代反馈和优化来改进 LLM 的初始输出。其核心思想是:首先使用 LLM 生成一个输出,然后让同一模型为其自身输出提供多方面的反馈;最后,同一模型根据自身的反馈对其先前生成的输出进行优化。与早期工作不同,该迭代优化框架不需要监督训练数据或强化学习,且仅需使用单一的 LLM。作者在 7 个不同的任务上进行了实验,范围从评论重写到数学推理,证明该方法优于直接生成。在所有任务中,使用 SELF-REFINE 生成的输出在人类评估和自动化指标上均优于直接使用 GPT-3.5 和 GPT-4 生成的输出,平均绝对提升达 20%。

主题/分类

  • 主要分类: 计算与语言 (Computation and Language, cs.CL)
  • 相关分类: 人工智能 (Artificial Intelligence, cs.AI);机器学习 (Machine Learning, cs.LG)

附加信息

  • 代码与数据: 代码、数据和演示可在 https://selfrefine.info/ 获取。
  • 引用格式: arXiv:2303.17651 [cs.CL]
9 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 13 ms
Developed with Cursor