OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2404.12387

ReKA Core:兼顾语言与视觉能力的多模态基础模型

 
  applewatch ·  2026-08-10 11:01:21 · 13 次点击  · 0 条评论  

Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models

基本信息

  • 提交时间:2024年4月18日
  • 作者:Reka Team(包含 Aitor Ormazabal、Che Zheng、Cyprien de Masson d'Autume、Dani Yogatama、Deyu Fu、Donovan Ong、Eric Chen、Eugenie Lamprecht、Hai Pham、Isaac Ong、Kaloyan Aleksiev、Lei Li、Matthew Henderson、Max Bain、Mikel Artetxe、Nishant Relan、Piotr Padlewski、Qi Liu、Ren Chen、Samuel Phua、Yazheng Yang、Yi Tay、Yuqi Wang、Zhongkai Zhu、Zhihui Xie 等)
  • 分类:计算机科学 > 计算与语言(cs.CL);计算机视觉与模式识别(cs.CV)
  • arXiv 编号:2404.12387

摘要

本文介绍了 Reka Core、Flash 和 Edge 三个强大的多模态语言模型,这些模型由 Reka 公司从零开始训练。Reka 模型能够处理并推理文本、图像、视频和音频输入。技术报告讨论了其中部分模型的训练细节,并提供了全面的评估结果。

研究显示,Reka Edge 和 Reka Flash 不仅达到了最先进水平,还在性能上超越了许多更大的模型,在其各自的计算级别中展现出超值的表现。与此同时,最强大、规模最大的模型 Reka Core 在自动评估和盲测人工评估中均逼近最佳前沿模型水平。

在图像问答基准测试中(如 MMMU、VQAv2),Core 的表现与 GPT4-V 具有竞争力。在多模态聊天方面,Core 在第三方盲测人工评估中排名第二最受青睐的模型,超越了 Claude 3 Opus 等其他模型。在文本基准测试中,Core 不仅在一系列成熟基准(如 MMLU、GSM8K)上与其他前沿模型表现相当,还在人工评估中优于 GPT4-0613。在视频问答任务中(Perception-Test),Core 超越了 Gemini Ultra。

模型已在生产环境中部署,可通过 http://chat.reka.ai 访问,非精挑细选的定性示例展示可在 http://showcase.reka.ai 查看。

13 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 23 ms
Developed with Cursor