本文介绍了 Reka Core、Flash 和 Edge 三个强大的多模态语言模型,这些模型由 Reka 公司从零开始训练。Reka 模型能够处理并推理文本、图像、视频和音频输入。技术报告讨论了其中部分模型的训练细节,并提供了全面的评估结果。
研究显示,Reka Edge 和 Reka Flash 不仅达到了最先进水平,还在性能上超越了许多更大的模型,在其各自的计算级别中展现出超值的表现。与此同时,最强大、规模最大的模型 Reka Core 在自动评估和盲测人工评估中均逼近最佳前沿模型水平。
在图像问答基准测试中(如 MMMU、VQAv2),Core 的表现与 GPT4-V 具有竞争力。在多模态聊天方面,Core 在第三方盲测人工评估中排名第二最受青睐的模型,超越了 Claude 3 Opus 等其他模型。在文本基准测试中,Core 不仅在一系列成熟基准(如 MMLU、GSM8K)上与其他前沿模型表现相当,还在人工评估中优于 GPT4-0613。在视频问答任务中(Perception-Test),Core 超越了 Gemini Ultra。
模型已在生产环境中部署,可通过 http://chat.reka.ai 访问,非精挑细选的定性示例展示可在 http://showcase.reka.ai 查看。