微软研究院近日发布了Phi-2,一个拥有27亿参数的小型语言模型。该模型在推理、数学和常识问答等任务上表现出色,性能甚至超越了参数量是其数倍的模型,例如Meta的Llama 2 70B和Mistral 8x7B。
Phi-2基于Transformer架构,采用1.4万亿令牌的训练数据,这些数据由合成数据集和网络数据组成。其训练策略强调数据质量,而非单纯追求数据规模,通过“教科书质量”的数据训练,使模型在复杂推理任务中展现出较强的能力。
微软表示,Phi-2已通过Azure AI模型目录向开发者开放,并计划在未来支持更多推理场景。该模型的发布为小型语言模型的发展提供了新的可能性,表明在特定条件下,小模型也能实现高性能,为资源受限的环境提供了新的选择。