神经信息处理系统大会(NeurIPS, Conference on Neural Information Processing Systems)是机器学习和计算神经科学领域的顶级国际会议。2025年NeurIPS会议即将举行,兰州大学信息科学与工程学院博士生张大鹏的最新论文《Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual Language Model》被该会议接收。

张大鹏博士今年已在人工智能顶会AAAI 2025中发表论文《MapExpert: Online HD Map Construction with Simple and Efficient Sparse Map Element Expert》,关于自动驾驶视觉-语言-动作(Vision-Language-Action, VLA)大模型的研究工作达到当前最佳性能(State-of-the-Art, SOTA)并发表论文《AutoDrive-R2: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving》。NeurIPS 2025论文是上述成果的姊妹篇,在自动驾驶大模型算法中另辟蹊径,提出拉近仿真和真实场景差距的新方法,为解决自动驾驶长尾效应提供了新思路。

近年来,兰州大学信息科学与工程学院周庆国教授团队以张大鹏为代表的硕博研究生在机器人、自动驾驶和视觉-语言模型(Vision-Language Model, VLM)方向持续深耕,在传感器、机械手臂、轮式机器人导航、端到端算法、VLA大模型等软硬件一体系统研究中硕果累累。此外,团队还与新加坡国立大学、阿里巴巴-高德等单位合作探索大模型推理能力和强化学习在VLA大模型的应用,取得了显著的成果。

论文介绍

论文题目:Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual Language Model

主要内容:自动驾驶是人工智能的重要应用之一。近年来的研究方法已经从单纯关注常见场景,逐渐转向处理复杂的长尾情况,例如细微的人类行为、交通事故以及不合规的驾驶模式。鉴于大语言模型(Large Language Model, LLM)在理解视觉与自然语言输入以及遵循指令方面展现出的能力,最新的方法将大语言模型融入自动驾驶系统,以提升推理能力、可解释性和在多样化场景下的表现。然而,现有方法通常依赖于真实世界数据(适用于工业部署)或专门为稀有或棘手场景设计的仿真数据,很少有方法能够有效整合这两类数据源的互补优势。为解决这一局限,本文针对自动驾驶场景提出了一种新颖的、由视觉语言模型(VLM)指导的端到端对抗迁移框架,将仿真中的长尾处理能力迁移到真实世界的部署中。该框架包括一个教师VLM模型、一个学生VLM模型以及一个判别器。教师和学生VLM模型采用共享的基础架构,称为“因果链视觉语言模型(Chain-of-Causality Visual Language Model, CoC VLM)”,该模型通过端到端的文本适配器融合时序信息,并支持链式推理(chain-of-thought reasoning),以推导复杂的驾驶逻辑。教师VLM和学生VLM分别在仿真数据集和真实世界数据集上独立预训练。判别器通过对抗性训练,借助一种新颖的反向传播策略,促进学生VLM模型将仿真的长尾处理能力迁移到真实世界环境中。实验结果表明,本文方法有效弥合了仿真与真实世界自动驾驶之间的差距,展现出未来研究的新前景。