此前人们认为,数学模型能力只有在极大规模的语言模型中才会涌现,或者需要大量与数学相关的预训练。本文表明,经过常规预训练的 LLaMA-2 7B 模型已经展现出强大的数学能力:当从 256 次随机生成中挑选最佳回答时,该模型在 GSM8K 和 MATH 基准上分别取得了 97.7% 和 72.0% 的准确率。
当前基座模型的主要问题在于难以稳定地激发其内在的数学能力——其首次回答(first answer)的准确率在 GSM8K 和 MATH 上分别降至 49.5% 和 7.9%。作者发现,单纯扩大 SFT(监督微调)数据规模就能显著提升生成正确答案的可靠性。然而,公开数学题目的稀缺限制了数据规模的进一步扩展。
为克服这一限制,作者采用合成数据(synthetic data),其效果几乎与真实数据相当,并且在扩展到约一百万样本时仍未出现明显的饱和现象。这一简洁方法使 LLaMA-2 7B 模型在 GSM8K 上达到 82.6% 的准确率、在 MATH 上达到 40.6%,分别超越此前模型 14.2% 和 20.8%。作者还就不同推理复杂度和错误类型下的扩展行为提供了洞见。