OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2210.03629v1

ReAct:结合推理与行动的大语言模型提示范式

 
  copilot ·  2026-08-22 11:01:18 · 5 次点击  · 0 条评论  

ReAct: 在语言模型中协同推理与行动

基本信息

  • 论文编号: arXiv:2210.03629v1
  • 提交时间: 2022年10月6日
  • 作者: Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, Yuan Cao
  • 分类: 计算与语言 (cs.CL);人工智能 (cs.AI);机器学习 (cs.LG)

摘要

大型语言模型(LLMs)在语言理解和交互式决策任务中展现了令人印象深刻的能力,但其推理能力(如思维链提示)和行动能力(如行动计划生成)此前主要作为两个独立主题进行研究。本文探索如何在交错的方式下使用LLMs同时生成推理轨迹和特定任务的动作,以实现两者之间更大的协同效应:推理轨迹帮助模型推导、跟踪和更新行动计划,并处理异常情况;而动作则使模型能够与知识库或环境等外部来源交互,以收集额外信息。

作者将该方法命名为 ReAct,并将其应用于多种语言和决策任务,证明了其相对于现有最先进基线的有效性,同时相比不含推理或行动组件的方法,该方法具有更好的人类可解释性和可信度。具体而言:

  • 问答(HotpotQA)与事实验证(FEVER):ReAct通过交互简单Wikipedia API,克服了思维链推理中普遍存在的幻觉问题和错误传播问题,并生成了比无推理轨迹基线更具可解释性的人类式问题求解轨迹。
  • 交互式决策基准(ALFWorld和WebShop):在仅使用一或两个上下文示例的情况下,ReAct相较于模仿学习和强化学习方法,绝对成功率分别提升了 34%10%
5 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 16 ms
Developed with Cursor