尽管大语言模型(LLMs)的最新进展显著提升了其在各类任务上的表现,但在复杂且符号化的多步推理(尤其是数学推理)方面仍面临挑战。为增强 LLMs 的数学推理能力,现有大多数工作依赖领域专家或 GPT-4 来获取高质量的过程监督数据,这不仅成本高昂,而且耗费大量人力。
本研究提出了一种创新框架 AlphaMath,通过利用蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS)绕过了对过程标注(来自人类或 GPT)的需求。该框架旨在释放一个经过良好预训练的大语言模型自主增强其数学推理能力的潜力。具体而言,作者将价值模型(value model)与大语言模型集成,在 MCTS 中自动生成过程监督信号与步骤级评估信号。此外,作者提出了一种高效的推理策略——步骤级束搜索(step-level beam search),其中价值模型被设计用于辅助策略模型(即大语言模型)导航更有效的推理路径,而非仅依赖先验概率。
在域内与域外数据集上的实验结果表明,即使没有 GPT-4 或人工标注的过程监督,AlphaMath 框架仍能达到与先前最先进方法相当甚至更优的效果。