Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao
尽管大型语言模型(LLMs)在语言理解和交互式决策任务中展现了令人印象深刻的能力,但它们的推理能力(例如思维链提示)和行动能力(例如行动计划生成)主要被作为独立主题进行研究。本文探索了让 LLMs 以交错方式生成推理轨迹和特定任务行动的方法,从而使二者之间产生更大的协同作用:推理轨迹帮助模型归纳、跟踪和更新行动计划以及处理异常情况,而行动则使其能够与外部数据源(如知识库或环境)进行交互以收集额外信息。我们将所提出的方法——ReAct 应用于一系列多样化的语言和决策任务,并证明了其相对于最先进基线的有效性,以及相较于没有推理或行动组成部分的方法,在人类可解释性和可信度方面的提升。具体来说,在问答任务(HotpotQA)和事实验证任务(Fever)上,ReAct 通过与简单的 Wikipedia API 交互,克服了思维链推理中常见的幻觉和错误传播问题,并生成了比没有推理轨迹的基线更具可解释性的人类式任务解决轨迹。在两个交互式决策基准(ALFWorld 和 WebShop)上,ReAct 分别以 34% 和 10% 的绝对成功率优于模仿学习和强化学习方法,而仅使用一个或两个上下文示例进行提示。项目网站及代码:https://react-lm.github.io