微软研究院近日发布Phi-3系列模型,包括Phi-3-mini、Phi-3-small和Phi-3-medium三个版本,参数规模分别为3.8B、7B和14B。其中Phi-3-mini在3.3万亿token上训练,性能可与Mixtral 8x7B和GPT-3.5等更大模型媲美,在MMLU、HellaSwag等基准测试中表现优异。

Phi-3系列采用Transformer架构,支持4K和128K上下文长度,并通过QLoRA等量化技术实现移动设备部署。微软强调,该系列模型在高质量数据上训练,注重数据筛选和课程学习,而非单纯扩大参数规模。目前Phi-3-mini已在Azure AI Studio、Hugging Face等平台开源,采用MIT许可证。