大晓机器人联合南洋理工大学S-Lab、上海人工智能实验室发布人-场景交互重建研究HSImul3R,直指三维视觉长期存在的“感知—仿真鸿沟”,推动三维重建从“视觉正确”走向“物理可执行”。该成果已被计算机视觉顶级会议ECCV 2026正式接收。
传统三维重建方法主要关注人和场景是否重建得像、是否对齐,但视觉上成立的交互进入物理仿真后往往失效:椅子可能因结构缺失倒下,人体也可能与椅面严重穿模。HSImul3R将重力稳定性、真实接触与交互稳定性纳入核心评价标准,团队将其定义为首个面向非标定稀疏视角输入、实现稳定可仿真人-场景交互重建的框架,并进一步支持单目视频输入。
团队同时构建了面向人-场景交互的HSIBench,直接检验重建结果能否在物理仿真中稳定交互。HSImul3R在Easy、Medium、Hard三档任务中的交互稳定率分别达到53.68%、30.56%和13.92%,显著高于HSfM的10.52%、4.50%和2.66%,并将人-场景三维穿模率从69.51%降至22.90%。
为实现这一目标,HSImul3R提出物理闭环双向优化框架,让物理仿真器从最终检验工具变成重建过程中的主动监督者。一方面通过面向场景的强化学习优化人体运动,使其既物理可行又能与当前场景稳定交互;另一方面通过直接仿真奖励优化,利用交互后的仿真反馈反向优化三维场景。
最终,团队将优化后的人体动作迁移至Unitree G1人形机器人,贯通日常图像或视频、三维人-场景交互重建、物理仿真优化、人形机器人动作迁移到真实机器人执行的完整链路,让人类视频中的交互经验转化为可仿真、可学习、可执行的机器人技能资产。
咨询
咨询