微软亚洲研究院近日开源了新一代多模态AI模型Florence-2,该模型在图像描述、视觉问答等任务上展现出卓越性能,多项指标超越GPT-4V。Florence-2采用创新的视觉-语言联合训练方法,能够高效处理图文混合输入,并生成高质量的自然语言输出。
据官方介绍,Florence-2在COCO Caption、Flickr30k等基准测试中均取得领先成绩,尤其在细粒度图像描述任务上表现突出。该模型现已开源,开发者可通过GitHub获取预训练权重和推理代码,这将极大推动多模态AI在搜索、教育等领域的应用落地。