📌 一句话概括
Drive-JEPA 用 V-JEPA(联合嵌入预测架构,非生成式)在大规模驾驶视频上自监督预训练 ViT,得到强规划表征;再用 仿真器生成的多模态伪教师轨迹蒸馏进在线生成的 proposal 规划器,并以动量感知选择保时序平滑——同时破解"世界模型预训练无效"与"单轨迹监督瓶颈"两个难题,NAVSIM 双榜 SOTA。

1. 动机:两个被忽视的瓶颈
端到端驾驶近两年拼命用视频世界模型预训练学可迁移表征,但效果有限。作者指出两类失败:
- 生成式世界模型(VaVAM、Epona):像素级重建/生成,算力重且过度关注与决策无关的视觉细节。
- 潜空间世界模型(LAW、World4Drive):预测未来特征,但通常只当辅助损失,没证明"扩大预训练"有用,且易表征坍塌。
另一瓶颈是监督稀疏:每场景只有一条人类轨迹,而驾驶本质是多模态的(多条都合理)。离散词表法(VADv2/Hydra-MDP)受限于词表覆盖;扩散法(DiffusionDrive)也只被单条人类轨迹监督,多样性受限。
Drive-JEPA 的统一解法:① 用 V-JEPA 做高效、防坍塌的视频预训练;② 用多模态轨迹蒸馏从仿真器引入多样监督。
2. 方法:三大组件
2.1 Driving Video Pretraining(V-JEPA)
V-JEPA 原理:对视频随机 mask 掉一些时空 patch,用编码器 $E_\theta$ 抽特征、预测器 $P_\phi$ 在 mask 位置预测目标分支(EMA 编码器 + stop-grad)的表征,只在 mask 位置算 L1 损失:
$$\min_{\theta,\phi,\Delta_y}\;\left\|P_{\phi}(\Delta_y, E_{\theta}(x)) - \mathrm{sg}(E_{\bar{\theta}}(y))\right\|_1$$内置 stop-grad + EMA,天然防表征坍塌——这正是它优于 MAE/潜世界模型的关键。
Drive-JEPA 实践:
- 初始化用 V-JEPA 2 发布的 ViT 权重,再从三大数据集(CoVLA、DrivingDojo、OpenScene)策展 208 小时驾驶视频(前视、8帧、512×256、2Hz)。
- 因潜预测任务高效,成功把预训练扩展到 208h(远超 LAW/World4Drive 的 ~20h),算力反而更低。
无感知设定验证:只给前视图像,用预训练 ViT 提特征 + 轻量 Transformer Decoder(M 个 learnable query 做 cross-attn)+ MLP 直接回归轨迹,MSE 监督。仅此简单 setup 就在 NAVSIM 无感知设定下达 89.0 PDMS,超 Epona(86.1)3 PDMS——证明 V-JEPA 预训练对规划真的有用。
2.2 Waypoint-anchored Proposals(在线生成候选)
受 iPad 启发,不依赖固定词表,而是在线迭代细化 proposal。给定视觉特征 $\mathbf{F}_t$ 与 ego 状态(线性投影成 $\mathbf{e}_t$):
- proposal query 初始化:$\mathbf{Q}_0 \in \mathbb{R}^{N_p\times M\times D}$,由 $\mathbf{e}_t$ + 可学习位置嵌入构成($N_p=32$ 个提案,M 个未来 waypoint)。
- 迭代 $L$ 次:MLP 把 $\mathbf{Q}\ell$ 解码成显式 waypoint 轨迹 $\tilde{W}\ell$ → 以这些 waypoint 为锚,用 WADA(Waypoint-anchored Deformable Attention) 在 $\mathbf{F}_t$ 的 BEV 特征上采样聚合 → MLP 更新 query: $$\mathbf{Q}_{\ell+1} = \mathrm{MLP}\big(\mathrm{WADA}(\mathbf{Q}_\ell, \tilde{W}_\ell, \mathbf{F}_t)\big)$$
- 粗到细:早期迭代权重低($\lambda=0.1$ 折扣),逐步聚焦。
朴素监督用 winner-take-all(对最近提案算 L2),但会限制多模态——引出下一节。
2.3 Multimodal Trajectories Distillation(MTD)★
为打破"单条人类轨迹"瓶颈,从规则仿真器蒸馏多模态监督:
- 建轨迹词表:聚类训练集 10 万+ 轨迹得 8192 中心(同 VADv2/Hydra-MDP 用法,但目的不同)。
- 对每场景,用 NAVSIM v2 的 EPDM 规则仿真器给词表每条轨迹打分(PID 转 41 点稠密轨迹 → replay 他车/红绿灯 → 算碰撞等指标),按排名+阈值选出一组多模态伪教师轨迹 $\mathcal{P}_t$。
- 训练时让 proposal 同时靠近人类轨迹和伪教师轨迹(而非只靠一条): $$\sum_{\ell=1}^{L}\lambda^{L-\ell}\Big(\min_n\lVert W_t-\tilde{W}_{\ell}^{(n)}\rVert_2 + \sum_{P\in\mathcal{P}_t}\min_n\lVert P-\tilde{W}_{\ell}^{(n)}\rVert_2\Big)$$
如图 3 所示:无 MTD 时 proposal 明显模态坍塌;加 MTD 后变多模态。这是缓解模仿学习模态坍塌的直接手段。
为什么不用扩散采样来产生多模态,而是用"伪教师蒸馏"? 两条路都能得多模态,但 MTD 有独特优势:扩散采样慢(100 步)、且采样出的轨迹未必"安全合规";而 MTD 的伪教师直接来自规则仿真器打分筛选过的轨迹,天然满足 NC/DAC/EP 等硬约束。等于把"多样性"和"安全性"一次性蒸馏进 proposal 分布——比让模型自己扩散探索高效得多。这也是它 Bench2Drive 闭环 DS 比 iPad 高 4 分的原因。
2.4 Momentum-aware Trajectory Selection
从 $N_p$ 个最终提案里选最优:对 $\mathbf{Q}_L$ 沿 waypoint 维 max-pool → MLP 打分到 $S$。用基于仿真 EPDMS 的 BCE 监督:
$$\mathcal{L}_{\text{score}} = \mathrm{BCE}(S, \hat{S})$$MTD 提升多样性的副作用是帧间抖动变大、舒适度下降。于是把分数改成动量感知:用上一帧选中轨迹 $\hat{W}_{t-1}$ 与当前各提案比较得舒适度项 $S_c$,重标定:
$$S \leftarrow \frac{7S + S_c}{8}$$最终选 $n^* = \arg\max_n S_n$。权重 7:1 沿用 NAVSIM v2 设定。
为什么要"动量感知"? 实车最忌讳轨迹一帧一个样(乘客晕、控制抖)。MTD 让 proposal 更多样后,相邻帧可能选出形状差异大的两条,导致输出轨迹跳变。动量项 $S_c$ 衡量"当前提案与上一帧选中轨迹的偏离度",把它按 1/8 权重揉进总分,等于给"突然变道/急转"悄悄扣分——在不牺牲安全的前提下保住时序平滑。这是把"舒适度"从评测指标前移成"选择偏好"的巧思。
2.5 损失
除轨迹与分数损失,用两个轻量辅助任务(兼容 proposal-centric 设计):
- Proposal-centric mapping:预测提案 waypoint 的"在路上/在路线"概率,BCE。
- Proposal-centric collision:log-replay 仿真估碰撞概率,L1 + 0.1·BCE。
总损失:$\mathcal{L} = \mathcal{L}{traj} + \mathcal{L}{score} + 2\mathcal{L}{map} + \mathcal{L}{colli}$(全程可微)。
训练 vs 推理的差异:预训练阶段(V-JEPA)和规划器训练是两阶段解耦的——先在大语料上把 ViT encoder 预训好并冻结/低学习率微调,再训 proposal-centric 规划器;推理时只跑规划器(前视相机 + 32 提案 + 轻量 Transformer),不触发任何仿真器或扩散。所有"仿真器打分"都只发生在训练时造伪教师标签,推理是纯前馈。这也是它能做到"仅前视相机即 SOTA"的工程基础。
3. 实验
3.1 NAVSIM v1(PDMS)
| 方法 | 输入 | PDMS ↑ |
|---|---|---|
| Hydra-MDP | C&L | 86.5 |
| DiffusionDrive | C&L | 88.1 |
| iPad | Camera | 91.1 |
| Drive-JEPA (ResNet34) | Camera | 91.5 |
| Drive-JEPA (ViT/L) | Camera | 93.3 |
仅前视相机、无 LiDAR,ViT/L 版达 93.3,仅次于用强数据增广的 DriveSuprim(93.5)。
3.2 NAVSIM v2(EPDMS)
| 方法 | Backbone | EPDMS ↑ |
|---|---|---|
| Hydra-MDP++ | R34 | 81.4 |
| iPad | R34 | 84.1 |
| DriveSuprim | R34 | 83.1 |
| Drive-JEPA (R34) | R34 | 85.4 |
| iPad | ViT/L | 85.8 |
| DriveSuprim | ViT/L | 87.1 |
| Drive-JEPA (ViT/L) | ViT/L | 87.8 |
v2 指标更严(含 DDC/TLC/LK/HC/EC),Drive-JEPA 双 backbone 均 SOTA,且 EC(扩展舒适度)表现突出。
3.3 Bench2Drive(闭环)
| 方法 | DS ↑ | SR ↑ |
|---|---|---|
| TCP | 59.90 | 30.00 |
| iPad | 60.52 | 33.18 |
| DriveTransformer | 63.46 | 35.01 |
| Drive-JEPA | 64.52 | 36.82 |
DS 与 SR 双超,比同为 proposal-centric 的 iPad 高 4 分 DS,验证 MTD 的有效性。
3.4 消融(模块叠加)
在 NAVSIM v2 上逐步加模块(EPDMS):
- 基线(iPad 式,无预训练):84.1
- $\mathcal{M}_1$ V-JEPA2 权重:85.8(+1.7)
- $\mathcal{M}_2$ 驾驶视频预训练:86.1(+2.0)
- $\mathcal{M}_3$ MTD:84.5(多样性↑但 EC 掉)
- $\mathcal{M}_4$ 动量感知选择:87.8(+3.7,EC 拉回 84.8)
→ 四模块缺一不可,动量感知选择是收尾关键。
4. 个人思考
1. JEPA 比生成式世界模型更适合"为决策学表征"。 生成式要重建像素,逼模型记住与驾驶无关的纹理;JEPA 只在潜空间预测"被 mask 的表征",目标就是"学可迁移的结构",且 EMA+stop-grad 天然防坍塌。Drive-JEPA 用 208h 视频把预训练规模做上去才显出威力——说明之前"世界模型预训练没用"可能只是规模/方法没到位,而非范式错误。
2. “多模态蒸馏"是缓解单轨迹瓶颈的干净解法。 不靠扩散采样、不靠固定词表,而是直接让仿真器当"多模态老师"批量产伪标签,把 proposal 分布拉开。比 Hydra-MDP 的 hydra-distillation(只学分数)更进一步——直接蒸馏轨迹形状本身。这对数据效率低的闭环场景尤其值钱。
3. 轻量即正义。 仅前视相机 + 32 个在线 proposal + 轻量 Transformer,就能双榜 SOTA。相比堆 LiDAR、堆 backbone 的同行,Drive-JEPA 证明了"好表征 + 好训练策略"可以抵消传感器劣势——对实车降本(少相机、少算力)是直接利好。
4. 与本期另两篇的呼应。 WoTE 用世界模型评估轨迹未来,GTRS 用世界模型式扩散生成候选,Drive-JEPA 用世界模型预训练表征——三条路分别把"世界模型"用在了规划链的不同环节,恰好勾勒出 2025-2026 端到端驾驶的三种世界观。求职面试时能讲清这条脉络,是很强的信号。
延伸阅读
- 世界模型评估轨迹:WoTE 论文精读
- 生成式候选:DiffusionDrive 代码讲解
- 检索式评分:SparseDriveV2 代码讲解
- 榜单背景:NAVSIM 排行榜深度分析