Genie: Generative Interactive Environments
基本信息
- 标题:Genie: Generative Interactive Environments
- 作者:Jake Bruce, Michael Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, Yusuf Aytar, Sarah Bechtle, Feryal Behbahani, Stephanie Chan, Nicolas Heess, Lucy Gonzalez, Simon Osindero, Sherjil Ozair, Scott Reed, Jingwei Zhang, Konrad Zolna, Jeff Clune, Nando de Freitas, Satinder Singh, Tim Rocktäschel(共 25 位作者)
- 提交时间:2024 年 2 月 23 日(v1)
- arXiv 编号:arXiv:2402.15391 [cs.LG]
- DOI:https://doi.org/10.48550/arXiv.2402.15391
- 项目页面:https://sites.google.com/corp/view/genie-2024/
主题分类
- 主分类:Machine Learning (cs.LG)
- 其他分类:Artificial Intelligence (cs.AI); Computer Vision and Pattern Recognition (cs.CV)
摘要
本文提出了 Genie,这是首个以无监督方式从无标注互联网视频中训练得到的生成式交互环境(generative interactive environment)。该模型可以根据文本、合成图像、照片甚至草图等提示,生成无穷无尽、可用动作控制的虚拟世界。Genie 拥有 110 亿参数,可被视为一个基础世界模型(foundation world model)。
Genie 由三部分组成:
1. 时空视频分词器(spatiotemporal video tokenizer)
2. 自回归动力学模型(autoregressive dynamics model)
3. 简洁且可扩展的潜在动作模型(latent action model)
尽管训练过程中不使用任何真实动作标签,也不依赖世界模型文献中常见的领域特定要求,Genie 仍允许用户在生成环境中逐帧进行操作。此外,所学到的潜在动作空间还能促进智能体从未见过的视频中模仿行为,为未来训练通用智能体(generalist agents)开辟了道路。