EVLA:首个融合车辆电驱状态感知的多模态驾驶助手
当前基于视觉-语言模型的驾驶辅助系统通常将车辆动力学视为黑箱,导致决策缺乏对车辆实时机电状态的感知。为弥补这一差距,研究团队在arXiv上提出了电-视觉-语言助手(EVLA)框架。该框架创新性地将多模态场景理解与电驱动力总成实时状态感知相结合。
EVLA包含两大核心技术:一是统一协同状态编码器(UCSE),它能将视觉、文本和车辆状态输入融合为共享潜在表示,并通过“能效场”建模空间能量成本;二是电感知结构化推理链(ESRC),它用基于物理约束和优化目标的内部确定性推理过程,替代了传统的外部思维链提示方法。
通过端到端的物理引导联合损失训练,EVLA学会了生成情境感知且能量最优的驾驶决策。在驾驶问答基准测试中,EVLA显著优于经过微调的视觉-语言模型基线,最终得分提升0.0871,准确率提高5.6%。消融研究验证了各组件的必要性,效率分析显示EVLA的推理速度比多阶段流水线快36%。
这项研究强调,整合车辆状态感知和结构化物理推理对于开发下一代基于物理现实的驾驶辅助系统至关重要。该工作为自动驾驶领域提供了新的研究方向,有望推动更安全、高效的智能驾驶系统发展。