本文介绍了 phi-3-mini,一个拥有 38 亿参数的语言模型,在 3.3 万亿 tokens 上训练而成。尽管其规模小到可以在手机上部署,但其整体性能(依据学术基准和内部测试衡量)可与 Mixtral 8x7B 和 GPT-3.5 等模型相媲美(例如,phi-3-mini 在 MMLU 上达到 69%,在 MT-bench 上达到 8.38)。
模型的训练数据集是 phi-2 所用数据集的扩展版本,由经过严格筛选的公开网络数据和合成数据组成。模型还针对鲁棒性、安全性和对话格式进行了进一步对齐。
文章还提供了参数扩展的结果:训练了 7B 和 14B 参数的模型(分别称为 phi-3-small 和 phi-3-medium),在 4.8T tokens 上训练,两者性能均显著优于 phi-3-mini(例如,MMLU 分别达到 75% 和 78%,MT-bench 分别达到 8.7 和 8.9)。
为增强多语言、多模态和长上下文能力,文章还介绍了 phi-3.5 系列的三种模型:
- phi-3.5-mini
- phi-3.5-MoE:一个 16×3.8B 的 MoE 模型,具有 66 亿活跃参数,在语言推理、数学和代码任务上优于同规模的其他开源模型(如 Llama 3.1 和 Mixtral 系列),并与 Gemini-1.5-Flash 和 GPT-4o-mini 持平。
- phi-3.5-Vision:一个 42 亿参数的模型,源自 phi-3.5-mini,擅长推理任务,能够处理单图像+文本提示以及多图像+文本提示。
24 页