大型语言模型(LLMs),如 GPT-4,在自然语言处理(NLP)任务中表现出色,包括具有挑战性的数学推理任务。然而,大多数现有的开源模型仅在大规模互联网数据上进行了预训练,并未针对数学领域进行专门优化。
本文提出了 WizardMath 模型,通过将作者提出的 强化 Evol-Instruct 反馈(RLEIF)(Reinforcement Learning from Evol-Instruct Feedback)方法应用于数学领域,在不使用外部 Python 工具的情况下,增强了 LLM 的数学链式推理(CoT)能力。
在 GSM8k 和 MATH 两个数学推理基准上的大量实验验证了该模型的卓越性能。值得注意的是,WizardMath-Mistral 7B 以更高的数据效率大幅超越了顶级开源 LLM;WizardMath 70B 甚至优于 GPT-3.5-Turbo、Claude 2、Gemini Pro 和 GPT-4 早期版本。初步探索还强调了指令进化和过程监督在实现卓越数学表现中的关键作用。
LLM(大语言模型)、数学推理(Mathematical Reasoning)