紫东太初最新开源的通用多模态大模型ZDTaichu5.0-9B,在九大国际权威空间理解基准测试中拿下八项第一,且通用能力未出现明显折损,将10B以下通用模型的空间具身能力上限进一步抬高。
过去的多模态模型虽能理解图片内容,但进入真实物理世界后,空间理解与行动能力往往跟不上;部分模型为补足空间能力又不得不牺牲通用能力。ZDTaichu5.0-9B试图同时跑通这两件事。在演示中,该模型可控制美工刀具完成拉开抽屉、放入、关闭等一连串动作,背后涉及刀柄位置、抽屉状态、夹爪对准等细致空间判断,并完成高层任务规划。
在具体测试中,模型能完成目标选择、参照系转换和交互条件判断三类任务。例如在杂物较多的台面上找到从左至右第二个银色盒子,给出归一化坐标(237,226)并落在目标区域内;在同一房间三个视角下,设想移动到绿框窗帘位置、面向蓝框沙发,正确判断红框柜子位于右前方;在最右侧杯子杯柄方向寻找空闲区域,同样准确落入正确区域。
成绩单显示,在10B档位开闭源模型中,ZDTaichu5.0-9B几乎断层领先。差距较大的MindCube-tiny上,ZDTaichu5.0-9B得分为78.27分,Gemma4 8B-E4B、Gemini 3 Pro和Grok 4分别为48.85、70.87和63.56。榜单覆盖空间感知、三维推理、多视角变换与具身交互。通用能力方面,图解理解基准AI2D达到91.48分,仅次于Gemini 3 Pro,高于其他对照模型。
咨询
咨询