OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2403.04706

V-JEPA:通过视频自监督预测学习世界模型表示

 
  stumble ·  2026-09-11 11:01:16 · 10 次点击  · 0 条评论  

Common 7B Language Models Already Possess Strong Math Capabilities

基本信息

  • 标题:Common 7B Language Models Already Possess Strong Math Capabilities
  • 作者:Chen Li, Weiqi Wang, Jingcheng Hu, Yixuan Wei, Nanning Zheng, Han Hu, Zheng Zhang, Houwen Peng
  • 提交日期:2024年3月7日
  • arXiv 编号:arXiv:2403.04706 [cs.CL]
  • 学科分类:Computation and Language (cs.CL);Artificial Intelligence (cs.AI)
  • DOI:https://doi.org/10.48550/arXiv.2403.04706

摘要

此前人们认为,数学模型能力只有在极大规模的语言模型中才会涌现,或者需要大量与数学相关的预训练。本文表明,经过常规预训练的 LLaMA-2 7B 模型已经展现出强大的数学能力:当从 256 次随机生成中挑选最佳回答时,该模型在 GSM8K 和 MATH 基准上分别取得了 97.7% 和 72.0% 的准确率。

当前基座模型的主要问题在于难以稳定地激发其内在的数学能力——其首次回答(first answer)的准确率在 GSM8K 和 MATH 上分别降至 49.5% 和 7.9%。作者发现,单纯扩大 SFT(监督微调)数据规模就能显著提升生成正确答案的可靠性。然而,公开数学题目的稀缺限制了数据规模的进一步扩展。

为克服这一限制,作者采用合成数据(synthetic data),其效果几乎与真实数据相当,并且在扩展到约一百万样本时仍未出现明显的饱和现象。这一简洁方法使 LLaMA-2 7B 模型在 GSM8K 上达到 82.6% 的准确率、在 MATH 上达到 40.6%,分别超越此前模型 14.2% 和 20.8%。作者还就不同推理复杂度和错误类型下的扩展行为提供了洞见。

10 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 13 ms
Developed with Cursor