业界对视觉-语言-动作(VLA)模型的追捧正面临反思。多位AI专家指出,VLA虽在机器人、自动驾驶等领域展现潜力,但远非通用人工智能的终极形态。当前VLA模型在复杂推理、长期规划和跨模态泛化上存在明显短板,且依赖海量标注数据,限制了其实际部署。
研究者认为,下一代AI系统需要深度融合多模态感知与符号推理,而非简单拼接视觉与语言模块。例如,结合因果推理与记忆机制的架构,或能突破VLA的“感知-行动”循环瓶颈。此外,强化学习与神经符号方法的结合,正在成为提升模型可解释性与鲁棒性的关键路径。
行业趋势表明,从“感知智能”迈向“认知智能”需要更根本的范式创新。VLA或许只是过渡,真正的终局将属于能自主理解、规划并适应动态环境的智能体。