谷歌DeepMind近日推出了一项名为“机器人引导模型”的新技术,旨在通过低成本方式提升AI机器人的操作能力。该模型利用大型语言模型(LLM)和视觉语言模型(VLM)的联合能力,无需大量真实机器人数据即可实现复杂任务引导,为具身智能领域提供了新的解决方案。
该技术核心在于将任务分解为可执行的子步骤,并利用VLM实时感知环境,指导机器人完成抓取、放置等操作。实验显示,该方法在多个模拟和真实场景中表现出色,显著降低了机器人部署的成本和门槛。相关论文已公开发布,代码和模型预计将逐步开源。
谷歌DeepMind近日推出了一项名为“机器人引导模型”的新技术,旨在通过低成本方式提升AI机器人的操作能力。该模型利用大型语言模型(LLM)和视觉语言模型(VLM)的联合能力,无需大量真实机器人数据即可实现复杂任务引导,为具身智能领域提供了新的解决方案。
该技术核心在于将任务分解为可执行的子步骤,并利用VLM实时感知环境,指导机器人完成抓取、放置等操作。实验显示,该方法在多个模拟和真实场景中表现出色,显著降低了机器人部署的成本和门槛。相关论文已公开发布,代码和模型预计将逐步开源。