自动驾驶领域再出一篇原创研究论文。任少卿指导发布论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,提出一种新的多模式世界—动作联合模型。公开学术记录中,他的代表性研究主要集中在2014至2016年,包括Faster R-CNN、ResNet等计算机视觉经典工作,此次他以通讯作者身份重新出现在自动驾驶论文中,论文第一机构为NIO,多位作者来自蔚来。
论文要解决的核心问题是:同一个驾驶场景下,系统需要处理的不只是一条轨迹,也不只是一个确定的未来。端到端自动驾驶的基本逻辑是将传感器观测直接映射为自车轨迹或控制指令,而World–Action Model进一步增加未来场景建模,让规划不仅依据当前环境,也参考动作可能带来的后果。
现有World–Action Model大致分两类路线。级联式方案先生成候选轨迹再预测对应未来场景,或先预测场景再规划,可生成多个候选,但信息单向传递,后生成的变量无法回头修正前面的决策。联合式方案将场景和动作放在同一生成过程中相互影响,具备双向交互能力,但通常只生成一组场景—动作结果。论文指出,真实道路往往需要同时处理多种结果与双向交互两件事。
MM-Future的方案是一次生成多组场景—动作假设,每一组内部的场景和动作继续共同演化,每组称为paired scene–action hypothesis。论文将多模式联合建模难点拆为三项:多样性从哪里产生、多组未来如何控制计算成本、生成多个候选后如何筛选。针对真实驾驶数据只记录单一结果的局限,模型在动作端建立Gaussian Mixture Noise,场景端使用独立噪声,并加入Best-of-Many监督,避免所有候选被同一条真值轨迹拉向相似结果。
为控制计算成本,作者提出MM-Tokens,将多摄像头、多时间帧的视觉特征压缩为面向规划的紧凑表示,不承担RGB图像重建,也无需恢复完整BEV,有限Token预算主要保留与未来演化和驾驶规划相关的信息。注意力可视化显示,MM-Tokens关注的信息集中在道路结构、路口、前车及周围交通参与者等区域。
扫码查看视频号
咨询
咨询