法国AI初创公司Mistral AI近日发布了其首款多模态模型Pixtral Large,该模型基于其文本模型Mistral Large 2打造,拥有1240亿参数,能够处理图像和文本输入。在多项基准测试中,Pixtral Large在图表理解、文档问答和多模态推理等任务上超越了GPT-4o、Gemini 2.0 Flash等竞品,展现了强大的视觉理解能力。

Pixtral Large支持高分辨率图像处理,能够对包含图表、公式和复杂文档的图像进行精准分析。该模型已在GitHub和Hugging Face上开源,采用Mistral Research License,允许非商业使用。Mistral AI还推出了Pixtral Large的API版本,定价为每百万token 2-6美元,与GPT-4o价格相近。

此次发布标志着Mistral AI在多模态AI领域迈出重要一步,有望推动企业级应用和自动化工作流的发展。同时,开源策略也引发了关于AI模型开放性与商业化的讨论。