OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2405.03553

MAmmoTH2:面向数学推理与工具使用联合优化的大模型方案

 
  bitter ·  2026-09-15 11:01:18 · 10 次点击  · 0 条评论  

AlphaMath Almost Zero: Process Supervision without Process

基本信息

  • 标题:AlphaMath Almost Zero: Process Supervision without Process
  • 作者:Guoxin Chen, Minpeng Liao, Chengxi Li, Kai Fan
  • 提交日期:2024 年 5 月 6 日(v1),最后修订于 2024 年 9 月 27 日(v3)
  • 会议:NeurIPS 2024(Camera ready version)
  • arXiv 编号:arXiv:2405.03553 [cs.CL]
  • 主题分类:Computation and Language (cs.CL);Artificial Intelligence (cs.AI)
  • DOI:https://doi.org/10.48550/arXiv.2405.03553

摘要

尽管大语言模型(LLMs)的最新进展显著提升了其在各类任务上的表现,但在复杂且符号化的多步推理(尤其是数学推理)方面仍面临挑战。为增强 LLMs 的数学推理能力,现有大多数工作依赖领域专家或 GPT-4 来获取高质量的过程监督数据,这不仅成本高昂,而且耗费大量人力。

本研究提出了一种创新框架 AlphaMath,通过利用蒙特卡洛树搜索(Monte Carlo Tree Search, MCTS)绕过了对过程标注(来自人类或 GPT)的需求。该框架旨在释放一个经过良好预训练的大语言模型自主增强其数学推理能力的潜力。具体而言,作者将价值模型(value model)与大语言模型集成,在 MCTS 中自动生成过程监督信号与步骤级评估信号。此外,作者提出了一种高效的推理策略——步骤级束搜索(step-level beam search),其中价值模型被设计用于辅助策略模型(即大语言模型)导航更有效的推理路径,而非仅依赖先验概率。

在域内与域外数据集上的实验结果表明,即使没有 GPT-4 或人工标注的过程监督,AlphaMath 框架仍能达到与先前最先进方法相当甚至更优的效果。

10 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 11 ms
Developed with Cursor