OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2308.09583v2

WizardMath:通过进化式指令数据提升数学推理表现

 
  python ·  2026-08-17 11:01:17 · 8 次点击  · 0 条评论  

WizardMath:通过强化 Evol-Instruct 增强大语言模型的数学推理能力

基本信息

  • 论文标题: WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
  • 作者: Haipeng Luo, Qingfeng Sun, Can Xu, Pu Zhao, Jianguang Lou, Chongyang Tao, Xiubo Geng, Qingwei Lin, Shifeng Chen, Yansong Tang, Dongmei Zhang
  • 分类: 计算机科学 > 计算与语言(cs.CL);人工智能(cs.AI);机器学习(cs.LG)
  • 提交日期: 2023年8月18日(v1);修订版:2025年1月1日(v2);最新版本:2025年6月4日(v3)
  • DOI: https://doi.org/10.48550/arXiv.2308.09583

摘要

大型语言模型(LLMs),如 GPT-4,在自然语言处理(NLP)任务中表现出色,包括具有挑战性的数学推理任务。然而,大多数现有的开源模型仅在大规模互联网数据上进行了预训练,并未针对数学领域进行专门优化。

本文提出了 WizardMath 模型,通过将作者提出的 强化 Evol-Instruct 反馈(RLEIF)(Reinforcement Learning from Evol-Instruct Feedback)方法应用于数学领域,在不使用外部 Python 工具的情况下,增强了 LLM 的数学链式推理(CoT)能力。

在 GSM8k 和 MATH 两个数学推理基准上的大量实验验证了该模型的卓越性能。值得注意的是,WizardMath-Mistral 7B 以更高的数据效率大幅超越了顶级开源 LLM;WizardMath 70B 甚至优于 GPT-3.5-Turbo、Claude 2、Gemini Pro 和 GPT-4 早期版本。初步探索还强调了指令进化和过程监督在实现卓越数学表现中的关键作用。

关键词

LLM(大语言模型)、数学推理(Mathematical Reasoning)

相关链接

8 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 15 ms
Developed with Cursor