OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2402.03300v3

DeepSeekMath:专为数学推理与定理求解优化的语言模型

 
  firewall ·  2026-08-19 11:01:19 · 8 次点击  · 0 条评论  

DeepSeekMath:推动开放语言模型数学推理能力的极限

作者

Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, Y.K. Li, Y. Wu, Daya Guo

摘要

数学推理因其复杂和结构化的特性,对语言模型构成了重大挑战。本文介绍了 DeepSeekMath 7B 模型,该模型在 DeepSeek-Coder-Base-v1.5 7B 的基础上,利用来自 Common Crawl 的 120B 数学相关 token 以及自然语言和代码数据继续进行预训练。

DeepSeekMath 7B 在竞赛级别的 MATH 基准测试 中取得了 51.7% 的优异成绩,且不依赖外部工具包和投票技术,性能已接近 Gemini-Ultra 和 GPT-4 的水平。对 DeepSeekMath 7B 的 64 个样本进行自我一致性(Self-consistency)评估,在 MATH 上达到了 60.9% 的得分。

该模型的数学推理能力主要归功于两个关键因素:
1. 数据选择流水线:通过精心设计的数据选择流程,充分利用了公开网络数据的巨大潜力;
2. GRPO 算法:引入了 Group Relative Policy Optimization(GRPO)——一种近端策略优化(PPO)的变体,在增强数学推理能力的同时优化了 PPO 的内存使用。

主题分类

  • 计算机科学 > 计算与语言(cs.CL)
  • 人工智能(cs.AI)
  • 机器学习(cs.LG)

论文信息

  • arXiv ID: 2402.03300
  • 提交日期: 2024年2月5日(v1)
  • 最后修订: 2024年4月27日(v3)
  • DOI: 10.48550/arXiv.2402.03300
8 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 21 ms
Developed with Cursor