一项具身任务本质上是多个角色的协同:机器人和相机等现场设备、云端算力、训练与推理程序,以及连接这些角色的通信和运行环境。随着更多机器人投入研发与应用,设备接入、任务部署、网络配置和故障排查的复杂度与成本将进一步放大。为此,清华大学与无问芯穹共同打造并开源面向具身智能的云原生纳管平台RLark。

平台以自研的具身设备运行时(embodied-runtime)和任务级跨集群网络互联技术为核心,打通“真实设备如何被统一调度”与“跨地域任务如何互联运行”两个关键环节。一方面,统一管理机器人、相机等具身设备的运行时环境,让设备可以像GPU一样被申请、调度和复用;另一方面,针对不同任务和网络流量特征,对跨集群通信进行任务级隔离,并优化大小包传输性能。

目前,RLark已完成3个集群、近百个云边端节点的统一纳管,覆盖4种型号的具身设备,设备纳管从小时级缩短至约5分钟,任务提交后可在10秒内启动运行。RLark进一步结合训练框架,打通了跨地域的采集、训练与真机验证闭环,为具身智能实验走向更大规模的设备与更复杂的协同场景提供基础支撑。

为验证云端算力与现场设备能否围绕同一项任务协同运行,团队将RLark与强化学习基础设施框架RLinf结合,在广东云端GPU集群与北京机器人现场之间完成了一次跨地域的真机实测。实验同时涉及现场机器人与相机、云端GPU,以及训练、推理和真机交互等多个执行角色,重点验证RLark能否让复杂实验更快准备、更简单运行,并形成完整的采集—训练—验证闭环。

RLark将从用户界面、API、后端服务,到任务编排、跨集群互联和具身设备运行时的整套能力开放出来,降低具身基础设施的使用门槛,让更多团队可以直接部署和使用。