OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2402.03300v2

DeepSeekMath:针对数学推理优化的大语言模型

 
  phishing ·  2026-07-29 11:01:19 · 12 次点击  · 0 条评论  
# DeepSeekMath: 推动开放语言模型数学推理的极限

## 作者
Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Mingchuan Zhang, Y.K. Li, Y. Wu, Daya Guo

## 摘要
数学推理因其复杂和结构化的特性,对语言模型构成了重大挑战。本文介绍了 **DeepSeekMath 7B**,该模型在 DeepSeek-Coder-Base-v1.5 7B 的基础上,使用来自 Common Crawl 的 1200 亿数学相关 token 以及自然语言和代码数据进行了继续预训练。DeepSeekMath 7B 在竞赛级别的 **MATH** 基准测试中取得了 **51.7%** 的出色成绩(无需借助外部工具包和投票技术),性能接近 Gemini-Ultra 和 GPT-4。通过自一致性(self-consistency)对 64 个样本进行集成后,MATH 分数达到了 **60.9%**。DeepSeekMath 的数学推理能力归功于两个关键因素:第一,通过精心设计的数据筛选流程,充分利用了公开网络数据的巨大潜力;第二,提出了 **GRPO**(Group Relative Policy Optimization),这是 PPO 的一种变体,它在增强数学推理能力的同时优化了 PPO 的内存使用。

## 主题/分类
- Computation and Language (cs.CL)
- Artificial Intelligence (cs.AI)
- Machine Learning (cs.LG)

## arXiv ID
2402.03300v2
12 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 15 ms
Developed with Cursor