Eric Zelikman, Georges Harik, Yijia Shao, Varuna Jayasiri, Nick Haber, Noah D. Goodman
人们在写作和交谈时,有时会停下来思考。尽管以推理为重点的工作往往将推理定义为回答问题或完成智能体任务的方法,但推理实际上隐含在几乎所有书面文本中。例如,证明中未明确写出的步骤,或对话背后的心理理论,都体现了这一点。
在 Self-Taught Reasoner(STaR, Zelikman et al. 2022)中,有用的思考通过从问答任务中的少量示例推断推理依据,并从那些导向正确答案的推理中学习而获得。这是一个高度受限的设置——理想情况下,语言模型可以学会在任意文本中推断未明说的推理依据。本文提出 Quiet-STaR,即 STaR 的泛化版本,其中语言模型学习在每个 token 处生成推理依据来解释未来的文本,从而提高其预测能力。
作者解决了以下关键挑战:
1. 生成续写的计算成本;
2. 语言模型最初不知道如何生成或使用内部思考;
3. 需要预测的不只是单个下一个 token。
为解决这些问题,作者提出了一种逐 token 并行采样算法,使用可学习的 token 来表示思考的开始和结束,并扩展了教师强制(teacher-forcing)技术。
实验结果: 令人鼓舞的是,生成的推理依据不成比例地有助于模型预测难以预测的 token,并提升了语言模型直接回答困难问题的能力。具体而言,在使用 Quiet-STaR 对互联网文本语料库进行持续预训练后,模型在 GSM8K 上取得了零样本性能提升(5.9% → 10.9%),在 CommonsenseQA 上从 36.3% 提升至 47.2%,并在自然文本的困难 token 上观察到困惑度改善。关键在于,这些改进无需在这些任务上进行任何微调。Quiet-STaR 标志着语言模型向更通用、可扩展的推理学习方式迈出了一步。