OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2402.08268

LWM:支持超长上下文建模的大规模语言模型

 
  face ·  2026-08-28 11:01:19 · 6 次点击  · 0 条评论  

World Model on Million-Length Video And Language With Blockwise RingAttention

作者

Hao Liu, Wilson Yan, Matei Zaharia, Pieter Abbeel

摘要

实现长上下文理解仍是扩展现有序列模型的关键挑战——这是开发能够处理并操作可能包含数百万 token 的长时序范围的通用智能模型的重要组成部分。本文旨在通过全面探索生产 1M 上下文语言模型和视频-语言模型的完整开发过程来应对这些挑战,在语言检索方面树立新基准,并在长视频理解方面实现新能力。文章详细介绍了长上下文数据整理流程、从 4K 到 1M token 的渐进式上下文扩展,并提供了一个用于长序列可扩展训练的高效开源实现。此外,作者还开源了一系列 7B 参数模型,能够处理超过 1M token 的长文本文档和视频。

主题/分类

  • 主要分类:Machine Learning (cs.LG)
  • arXiv ID:2402.08268

其他信息

  • 提交记录:2024年2月13日提交初版(v1),2025年2月3日最后修订(v4)
  • DOI:https://doi.org/10.48550/arXiv.2402.08268
6 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 87 ms
Developed with Cursor