Hao Liu, Wilson Yan, Matei Zaharia, Pieter Abbeel
实现长上下文理解仍是扩展现有序列模型的关键挑战——这是开发能够处理并操作可能包含数百万 token 的长时序范围的通用智能模型的重要组成部分。本文旨在通过全面探索生产 1M 上下文语言模型和视频-语言模型的完整开发过程来应对这些挑战,在语言检索方面树立新基准,并在长视频理解方面实现新能力。文章详细介绍了长上下文数据整理流程、从 4K 到 1M token 的渐进式上下文扩展,并提供了一个用于长序列可扩展训练的高效开源实现。此外,作者还开源了一系列 7B 参数模型,能够处理超过 1M token 的长文本文档和视频。