OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2404.14219v4

Phi-3 Technical Report:小模型也能实现高质量推理与通用能力

 
  utmost ·  2026-08-12 11:01:13 · 13 次点击  · 0 条评论  

Phi-3 技术报告:一款可本地部署于手机的高能力语言模型

基本信息

  • 作者:Marah Abdin 等(共 128 位作者)
  • 提交时间:2024 年 4 月 22 日(v1),最后修订于 2024 年 8 月 30 日(v4)
  • 分类:计算与语言(cs.CL);人工智能(cs.AI)
  • DOI:https://doi.org/10.48550/arXiv.2404.14219

摘要

本文介绍了 phi-3-mini,一个拥有 38 亿参数的语言模型,在 3.3 万亿 tokens 上训练而成。尽管其规模小到可以在手机上部署,但其整体性能(依据学术基准和内部测试衡量)可与 Mixtral 8x7BGPT-3.5 等模型相媲美(例如,phi-3-mini 在 MMLU 上达到 69%,在 MT-bench 上达到 8.38)。

模型的训练数据集是 phi-2 所用数据集的扩展版本,由经过严格筛选的公开网络数据和合成数据组成。模型还针对鲁棒性、安全性和对话格式进行了进一步对齐。

文章还提供了参数扩展的结果:训练了 7B14B 参数的模型(分别称为 phi-3-smallphi-3-medium),在 4.8T tokens 上训练,两者性能均显著优于 phi-3-mini(例如,MMLU 分别达到 75% 和 78%,MT-bench 分别达到 8.7 和 8.9)。

为增强多语言、多模态和长上下文能力,文章还介绍了 phi-3.5 系列的三种模型:
- phi-3.5-mini
- phi-3.5-MoE:一个 16×3.8B 的 MoE 模型,具有 66 亿活跃参数,在语言推理、数学和代码任务上优于同规模的其他开源模型(如 Llama 3.1 和 Mixtral 系列),并与 Gemini-1.5-Flash 和 GPT-4o-mini 持平。
- phi-3.5-Vision:一个 42 亿参数的模型,源自 phi-3.5-mini,擅长推理任务,能够处理单图像+文本提示以及多图像+文本提示。

论文篇幅

24 页

13 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 17 ms
Developed with Cursor