OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2308.09583v1

WizardMath:通过进化式指令数据增强数学能力

 
  telescope ·  2026-07-29 11:01:20 · 13 次点击  · 0 条评论  
# WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct

- **作者:** Haipeng Luo, Qingfeng Sun, Can Xu, Pu Zhao, Jianguang Lou, Chongyang Tao, Xiubo Geng, Qingwei Lin, Shifeng Chen, Dongmei Zhang
- **分类:** Computation and Language (cs.CL); Artificial Intelligence (cs.AI); Machine Learning (cs.LG)
- **提交日期:** 2023年8月18日(v1)
- **论文链接:** [arXiv:2308.09583](https://arxiv.org/abs/2308.09583)

## 摘要

大型语言模型(LLMs),如GPT-4,在自然语言处理任务中表现出色,包括具有挑战性的数学推理。然而,大多数现有的开源模型仅在大规模互联网数据上进行预训练,并未针对数学进行优化。

在本文中,我们提出了 **WizardMath**,该方法通过将我们提出的 **从进化指令反馈中强化学习(Reinforcement Learning from Evol-Instruct Feedback, RLEIF)** 方法应用于数学领域,增强了 Llama-2 的数学推理能力。

通过在两个数学推理基准测试 GSM8k 和 MATH 上进行的大量实验,我们展示了该模型的卓越能力。WizardMath 以显著优势超越了所有其他开源LLM。此外,我们的模型在 GSM8k 上甚至优于 ChatGPT-3.5、Claude Instant-1、PaLM-2 和 Minerva,同时在 MATH 上超越了 Text-davinci-002、PaLM-1 和 GPT-3。

更多细节和模型权重已公开在 [GitHub](https://github.com/nlpxucan/WizardLM) 和 [Hugging Face](https://huggingface.co/WizardLM)。

## 主题/关键词

LLM, 数学推理, 强化学习, 进化指令
13 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 11 ms
Developed with Cursor