字节跳动研究团队日前正式发布GR-2机器人基础模型,该模型旨在解决机器人学习中的泛化难题,提升机器人在复杂环境中的操作能力。GR-2通过大规模视频预训练与交互式学习,实现了对物体操控、工具使用等任务的跨场景迁移,尤其在灵巧操作方面表现出色。
据悉,GR-2采用“视频生成+动作执行”的统一框架,模型能够根据视觉输入预测未来帧并规划动作序列。在多项基准测试中,GR-2的指令跟随成功率和任务完成率均显著优于现有方法。研究团队表示,该模型为机器人从实验室走向真实应用提供了新的技术路径,未来有望在工业、家庭服务等领域落地。