📄 论文信息

项目内容
标题MAN TruckScenes: A multimodal dataset for autonomous trucking in diverse conditions
团队MAN Truck & Bus SE × Technical University of Munich(Felix Fent, Fabian Kuttenreich, Florian Ruch, Farija Rizwin, Stefan Juergens, Lorenz Lechermann, Christian Nissler, Andrea Perl, Ulrich Voll, Min Yan, Markus Lienkamp)
发表arXiv 2407.07462,NeurIPS 2024 Datasets and Benchmarks Track
代码/数据truckscenes-devkit / 项目主页 / AWS Open Data
关键词重卡自动驾驶、多模态数据集、4D 雷达、nuScenes 格式、长距离感知、卡车特有挑战

一句话概括:MAN TruckScenes 是第一个专门为自动驾驶重卡做的大规模多模态数据集——它把传感器架在 3.2 米高的重卡上、用 6 个 4D 雷达拼出几乎 360° 的覆盖,并首次给出带 3D 框标注的雷达点云,让研究者第一次能系统性研究「拖车遮挡、底盘-驾驶室相对运动、物流场站」这些轿车数据集里根本不存在的卡车难题。


🤔 要解决什么问题?

先解释几个名词(小白友好版)

  • 多模态数据集(Multimodal Dataset):同时提供相机、激光雷达、雷达、定位等多种传感器数据的数据库。不同模态互补:相机看纹理颜色、激光雷达看精确几何、雷达看速度和雨雾穿透。
  • 4D 雷达(4D Radar):相比只能测「距离 + 方位」的传统 3D 雷达,4D 雷达额外能分辨俯仰角(高度),于是每个点有 (x, y, z, 径向速度)。它能直接输出稠密点云,且不怕雨雾、能测速。
  • 标注范围(Annotation Range):数据集给物体画 3D 框的最远距离。nuScenes 约 141 米、Waymo 仅 80 米;重卡在高速上要提前几百米决策,范围太短会「瞎」。
  • 场景标签(Scene Tag):给每个片段打的环境标签,比如「雨」「雪」「夜间」「隧道」「物流场站」。用来分析模型在不同条件下的表现。
  • nuScenes 格式(nuScenes Format):一种通用的自动驾驶数据组织规范(scene / sample / sweep / annotation / calibration),很多成熟代码(mmdet3d、devkit)直接兼容。
  • NDS(nuScenes Detection Score):nuScenes 提出的综合检测指标,是 mAP 与 5 个真阳性误差(平移/尺寸/朝向/速度/属性)的加权平均,比单纯 IoU-mAP 更全面。
  • sweep(扫掠帧):两次带标注的关键帧之间、不带标注的中间传感器帧。保留它们能让多帧点云拼接、运动补偿更准。

核心矛盾:城市轿车数据集喂不饱重卡

过去十年的自动驾驶研究,几乎被 KITTI、nuScenes、Waymo Open、Argoverse 这类数据集「带偏」了——它们清一色是城市、低速、乘用车场景。论文在相关工作中直接点破:当时唯一沾点「卡车」的数据集,一个是 TuSimple(只有前视相机车道线标注),一个是 SurMine(矿场私有、仅 2D 框)。没有任何大规模、多模态、带 3D 标注的重卡感知数据集

但重卡和乘用车完全不同,直接拿轿车数据训出来的模型上车会踩一堆坑:

卡车特有挑战为什么轿车数据集没有后果
拖车动态遮挡乘用车没有可活动的挂车挂车拐弯时遮挡区域实时变化,后方目标忽隐忽现
底盘-驾驶室相对运动乘用车是一整块刚性体传感器架在驾驶室上,过颠簸路面时驾驶室相对底盘晃动,标定易漂
传感器得架很高轿车传感器离地不到 2 米重卡把激光雷达架到 2.2~3.2 米,视角和轿车完全两样
物流场站环境城市数据集没有集装箱堆场满地金属集装箱,雷达多径反射爆炸
高速远距离决策城市 50 米够用重卡制动距离长,150 米外就得看清

一句话结论:MAN TruckScenes 就是为了补齐「重卡感知数据空白」而生——它不只把传感器搬上卡车,更把卡车独有的遮挡、运动、场站、长距离问题一次性端到学者面前。


🔧 传感器套件:把重卡武装到牙齿

MAN TruckScenes 直接基于 nuScenes 格式构建,但传感器数量和布局是为重卡重新设计的。整套配置如下(论文 Table 2):

  • 相机:4 台 Sekonix SF3324,RGB,10 Hz,1928×1208,视场 120°×73°
  • 激光雷达:2 台禾赛 Pandar64(10 Hz,64 线,360°×40°,200 米@10%)+ 4 台 Ouster OS0(10 Hz,64 线,360°×90°,35 米@10%),共 6 台
  • 雷达:6 台大陆 ARS 548 RDI(20 Hz,76 GHz,100°×28°),这是4D 雷达
  • GNSS:1 台 GeneSys ADMA-G-PRO+,100 Hz,双天线测航向,定位精度 0.01 米
  • IMU:2 台 Xsens MTi-680G-SK,100 Hz,9 自由度

布局上的三个「卡车小心机」

  1. 两个侧置传感器模组(corner modules):左右各一组,每组含 2 相机 + 1 激光雷达 + 3 雷达。把主感知传感器分散到车身两侧,既最大化空间覆盖、又减小相对运动。
  2. 激光雷达架到 2.2 米(模组)和 3.2 米(车顶):高位置能减少遮挡、保护行人、防撞传感器,但也意味着视角和轿车数据集天差地别——这是论文反复强调的「novel sensor perspectives」。
  3. 双 IMU 分别架在底盘和驾驶室:一个测整车状态,一个测底盘-驾驶室相对运动。这正是为了补偿「驾驶室相对底盘晃动」这个卡车专属难题。

4D 雷达是最大亮点

6 台 4D 雷达拼出接近 360° 的空间覆盖(仅被挂车自身遮挡一点)。关键数字:

  • 每个雷达样本平均 2600 个点,而 nuScenes 的传统雷达每帧只有约 200 个点——差了一个数量级。
  • 因此 MAN TruckScenes 是第一个提供 360° 4D 雷达覆盖、且带 3D 框标注的数据集,也是目前最大的带标注雷达数据集。

关键认知:4D 雷达点云稠密到足以单独跑检测网络(论文用 RadarGNN 直接吃雷达点云),这让「纯雷达感知」「雷达-激光雷达融合」在重卡上第一次有了像样的数据支撑。


🧩 数据是怎么采、怎么标、怎么分的

采集与同步

  • 从超过 25 小时行驶记录里人工挑出 747 个约 20 秒场景,覆盖高速、场站、乡村、城市,三个季节,以及雨/雾/雪、夜间/黄昏等恶劣条件。
  • 时间同步用 PTP(IEEE 1588)精密时钟协议,各传感器时钟偏差小于 100 微秒,并对齐到 UTC。
  • 触发同步以激光雷达为参考:先相位同步各激光雷达,再在「激光扫到图像中心」的时刻触发相机,最后错频触发雷达以减小互干扰。
  • 标定四步走(外参初标 → 联合外参内标 → 航向角修正 → 数据级+应用级验证),相机-激光雷达达到像素级精度。

标注质量

  • 2 Hz 的关键帧上人工标 3D 框,基于「融合 + 自车运动补偿」的点云。
  • 标注经过最多三轮独立标注 + 质检循环,随机样本还要过双控复核。框用中心点 (x,y,z)、尺寸 (w,l,h)、四元数朝向表示。
  • 27 个物体类(层级结构)、15 个属性值(5 类属性,如可见性/活动状态)、全场景34 个场景标签(分 7 大类:区域、天气、光照等)。
  • 物体在整个场景里持续跟踪,带唯一 ID。
  • 隐私:人脸和车牌打码、时间戳匿名化,但时间一致性保留。

数据集切分(用遗传算法找 Pareto 最优)

train / val / test 按 70% / 10% / 20% 分。但怎么分才能让各子集「既不同(测泛化)又相似(公平评测)」?论文把这个多目标优化问题用 NSGA-II 遗传算法求解:

  • 目标 f1~f8:让各切分的类别分布、7 类场景标签分布偏差最小;
  • 目标 f9~f10:最大化切分内时间/空间标准差;
  • 目标 f11~f12:最大化切分间时间/空间的 KL 散度。

这种「用进化算法做数据集划分」的做法很工程化,值得做数据集的人抄。


🎯 支持的任务与评测

MAN TruckScenes 支持检测、跟踪、预测、定位等多种任务,但重点放在 3D 目标检测

  • 检测任务用 12 个类(从 27 标注类里挑出跨切分都存在、且标注不易混淆的子类,并新增「动物」「交通标志」两类)。
  • 评测沿用 NDS,但把检测范围从 nuScenes 的 50 米放宽到 150 米,专门逼模型做长距离检测——这对高速重卡至关重要。

📊 基线实验:三种模态各自的水平

论文给了相机 / 雷达 / 激光雷达三套基线(test split,v1.0),结果如下:

方法模态mAPNDSATEASEAOEAVEAAE
PETR(FCOS3D 预训练骨干)相机0.020.121.130.690.651.500.56
RadarGNN(6 帧聚合 4D 雷达)雷达0.070.110.890.811.138.000.57
CenterPoint(3 帧聚合激光雷达)激光雷达0.270.410.410.350.282.730.20

几个有意思的观察:

  • 激光雷达明显最强(NDS 0.41),但距离越远、冬天/隧道条件下质量明显下降,且对训练样本量更敏感。
  • 相机在少数类和恶劣天气/光照下很吃力(mAP 仅 0.02),基本不可用。
  • 雷达对所有非金属类都不行(金属反光才好),且在隧道、集装箱场站里被多径反射坑惨(AVE 高达 8.00,速度误差爆炸)。
  • 总体结论:重卡的安全运行还需要更鲁棒的长距离感知,单一模态都不够。这其实是在喊话「该上多模态融合 / 端到端融合」了。

⚖️ 和本博客另一篇 TruckDrive 怎么比

我之前写过 TruckDrive 精读(CVPR 2026,Torc × 普林斯顿),它和 MAN TruckScenes 是「重卡数据集双子星」,但取向不同:

维度MAN TruckScenesTruckDrive
发表NeurIPS 2024 D&BCVPR 2026
传感器4 相机 + 6 激光雷达 + 6 个 4D 雷达7 长距 FMCW 激光雷达 + 10 个 4D 雷达 + 11~15 相机
标注范围3D 框到约 226 米3D 框到 400 米、2D 到 1000 米
最大亮点首个 360° 4D 雷达带标注 + nuScenes 格式 devkit把长距离边界推到极致,证明 150 米外模型就「瞎」
场景高速 + 场站 + 城乡 + 三季 + 恶劣天气高速 hub-to-hub 为主
格式nuScenes 格式(易迁移)自有格式

两者互补:MAN 胜在「模态全、格式友好、雷达稠密」,TruckDrive 胜在「距离更远、长距压力测试更狠」。做重卡感知/端到端的人,两个都该下。


🚧 局限(论文自己承认的)

  • 只有感知,没有规划/控制标注:它是感知数据集,不含端到端驾驶动作或闭环规划评测(不像 nuPlan)。想练重卡端到端规划得另找数据。
  • 样本量仍偏小:747 场景、约 3 万带标关键帧,和 nuScenes(4 万关键帧)接近但远小于 Waymo(23 万)。
  • 雷达标定只靠摄影测量,角误差可能到 0.03°、内部错位无法完全排除;相机内参在图像边缘不确定性增大。
  • 地理覆盖集中德国:虽然比很多数据集大(约 100 km²),但域外泛化仍待验证。
  • 许可证 CC BY-NC-SA 4.0:非商业,工业直接拿来训练卖钱的产品要注意合规。

💡 个人思考(站在 VLA / 端到端视角)

作为做重卡端到端驾驶的工程师,我对 MAN TruckScenes 最兴奋的有三点:

  1. nuScenes 格式 = 零成本迁移。我们现有的 BEV / 检测 / 端到端代码几乎能直接吃这份数据,把「卡车视角」作为新域做预训练或域适应,成本极低。
  2. 4D 雷达点云是融合的金矿。激光雷达在雨雾掉点、相机在夜间瞎,但 4D 雷达又密又能测速——把它作为端到端模型的独立 token 流(而非后融合),很可能显著提升恶劣天气下的重卡安全率。这正是我们「重卡安全」系列(TruckDrive / TruckV2X / CargoLoad-RSS / AntiRollover-APF)一直关心的落点。
  3. 150 米评测范围点出了真问题。我们 Flow-GRPO 类的扩散规划在长尾/远距场景下也容易「看不见就乱开」,而 MAN 的基线已经用数据证明:单模态在 150 米外基本失效。下一步值得做的是「用 MAN 的远距离标注训感知 + 用扩散规划做长视界决策」的组合。

一句话收尾:MAN TruckScenes 不是又一个「换个车的数据集」,而是第一次把重卡的**物理结构难题(拖车遮挡、高视角、底盘-驾驶室运动)工况难题(场站、雨雾、夜间、长距离)**系统性地交到社区手里。对想做重卡端到端的人,它是绕不开的起跑线。


📚 参考资料