思考|重卡 VLA 是一个巨大的研究空白——兼论 Truck-VLA 架构设计

引言:100 篇 VLA 论文,0 篇属于重卡 如果你关注自动驾驶领域的最新进展,一定注意到 2024-2026 年间 VLA(Vision-Language-Action)模型的爆发式增长。从 AutoVLA、DriveVLM、EMMA、OpenDriveVLA 到 SAMoE-VLA、LaST-VLA、UniDriveVLA,光是 arXiv 上能找到的自动驾驶 VLA 论文就已超过 100 篇。 但这里有一个令人震惊的事实: 这 100+ 篇论文,没有一篇专门针对重卡(heavy-duty truck)场景。 所有模型都在乘用车数据集(nuScenes、Waymo Open Dataset、Bench2Drive、CARLA)上训练和评测。 与此同时,重卡自动驾驶的产业化进程正在加速:Aurora 于 2025 年在德州启动了无安全员的 L4 商业运营,Kodiak AI 已将 VLM 部署在自家卡车感知栈上,Torc Robotics 计划 2027 年量产 L4 卡车。重卡自动驾驶的市场需求是真实且急迫的——美国卡车运输业每年承担着超过 7000 亿美元的货物运输,卡车司机缺口超过 10 万人。然而学术界对重卡 VLA 的研究仍然是一片空白。这不仅是学术上的缺憾,更是产业落地的关键瓶颈。 本文的目标是: 定义这个空白:为什么现有 VLA 方法不能直接迁移到重卡? 分析根本原因:哪些维度造成了迁移障碍? 提出架构方案:Truck-VLA 应该怎么设计? 给出路线图:从哪里开始填补这个空白? 一、VLA 简史:从 VA 到 VLA 的演进 在深入重卡之前,先回顾一下自动驾驶 VLA 的整体图景。 1.1 三个时代 自动驾驶的"感知-决策-控制"管线经历了三个阶段: VA 时代(2016-2023):视觉-动作模型,直接从传感器映射到控制输出。代表工作包括 ALVINN、ChauffeurNet、TransFuser、UniAD、VAD。核心局限是黑盒推理、长尾泛化差、无法理解语言指令。这一时期的模型本质上是"感知→轨迹"的纯回归映射,缺乏显式推理能力。 ...

2026年7月23日 · 16 分钟 · 3216 字