在AI感知能力向多模态融合加速迈进之际,一项突破性研究将触觉维度首次植入世界模型。研究团队利用50万小时交互视频训练出首个隐式触觉世界动作模型,使AI不仅能“看”到物体运动,还能“感受”其物理交互的触觉反馈。这一成果标志着世界模型从纯视觉预测迈向具身感知的关键一步。
传统世界模型依赖视觉输入模拟物理世界,但缺乏对触觉等接触式信息的理解。新模型通过海量视频数据隐式学习触觉特征,无需额外传感器即可预测动作对物体的触觉影响。实验显示,该模型在抓取、推拉等操作任务中显著提升动作精度与物理合理性,为机器人灵巧操作、虚拟现实交互等场景开辟新路径。
研究团队表示,隐式触觉的引入使世界模型更接近人类对物理世界的多感官认知,未来有望融合更多感知模态,推动通用具身智能的发展。