ReAct: 在语言模型中协同推理与行动
基本信息
- 论文编号: arXiv:2210.03629v1
- 提交时间: 2022年10月6日
- 作者: Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao
- 分类: 计算与语言 (cs.CL);人工智能 (cs.AI);机器学习 (cs.LG)
摘要
大型语言模型(LLMs)在语言理解和交互式决策任务中展现了令人印象深刻的能力,但其推理能力(如思维链提示)和行动能力(如行动计划生成)此前主要作为两个独立主题进行研究。本文探索如何在交错的方式下使用LLMs同时生成推理轨迹和特定任务的动作,以实现两者之间更大的协同效应:推理轨迹帮助模型推导、跟踪和更新行动计划,并处理异常情况;而动作则使模型能够与知识库或环境等外部来源交互,以收集额外信息。
作者将该方法命名为 ReAct,并将其应用于多种语言和决策任务,证明了其相对于现有最先进基线的有效性,同时相比不含推理或行动组件的方法,该方法具有更好的人类可解释性和可信度。具体而言:
- 问答(HotpotQA)与事实验证(FEVER):ReAct通过交互简单Wikipedia API,克服了思维链推理中普遍存在的幻觉问题和错误传播问题,并生成了比无推理轨迹基线更具可解释性的人类式问题求解轨迹。
- 交互式决策基准(ALFWorld和WebShop):在仅使用一或两个上下文示例的情况下,ReAct相较于模仿学习和强化学习方法,绝对成功率分别提升了 34% 和 10%。