📄 论文信息
| 项目 | 内容 |
|---|---|
| 标题 | MAN TruckScenes: A multimodal dataset for autonomous trucking in diverse conditions |
| 团队 | MAN Truck & Bus SE × Technical University of Munich(Felix Fent, Fabian Kuttenreich, Florian Ruch, Farija Rizwin, Stefan Juergens, Lorenz Lechermann, Christian Nissler, Andrea Perl, Ulrich Voll, Min Yan, Markus Lienkamp) |
| 发表 | arXiv 2407.07462,NeurIPS 2024 Datasets and Benchmarks Track |
| 代码/数据 | truckscenes-devkit / 项目主页 / AWS Open Data |
| 关键词 | 重卡自动驾驶、多模态数据集、4D 雷达、nuScenes 格式、长距离感知、卡车特有挑战 |
一句话概括:MAN TruckScenes 是第一个专门为自动驾驶重卡做的大规模多模态数据集——它把传感器架在 3.2 米高的重卡上、用 6 个 4D 雷达拼出几乎 360° 的覆盖,并首次给出带 3D 框标注的雷达点云,让研究者第一次能系统性研究「拖车遮挡、底盘-驾驶室相对运动、物流场站」这些轿车数据集里根本不存在的卡车难题。
🤔 要解决什么问题?
先解释几个名词(小白友好版)
- 多模态数据集(Multimodal Dataset):同时提供相机、激光雷达、雷达、定位等多种传感器数据的数据库。不同模态互补:相机看纹理颜色、激光雷达看精确几何、雷达看速度和雨雾穿透。
- 4D 雷达(4D Radar):相比只能测「距离 + 方位」的传统 3D 雷达,4D 雷达额外能分辨俯仰角(高度),于是每个点有 (x, y, z, 径向速度)。它能直接输出稠密点云,且不怕雨雾、能测速。
- 标注范围(Annotation Range):数据集给物体画 3D 框的最远距离。nuScenes 约 141 米、Waymo 仅 80 米;重卡在高速上要提前几百米决策,范围太短会「瞎」。
- 场景标签(Scene Tag):给每个片段打的环境标签,比如「雨」「雪」「夜间」「隧道」「物流场站」。用来分析模型在不同条件下的表现。
- nuScenes 格式(nuScenes Format):一种通用的自动驾驶数据组织规范(scene / sample / sweep / annotation / calibration),很多成熟代码(mmdet3d、devkit)直接兼容。
- NDS(nuScenes Detection Score):nuScenes 提出的综合检测指标,是 mAP 与 5 个真阳性误差(平移/尺寸/朝向/速度/属性)的加权平均,比单纯 IoU-mAP 更全面。
- sweep(扫掠帧):两次带标注的关键帧之间、不带标注的中间传感器帧。保留它们能让多帧点云拼接、运动补偿更准。
核心矛盾:城市轿车数据集喂不饱重卡
过去十年的自动驾驶研究,几乎被 KITTI、nuScenes、Waymo Open、Argoverse 这类数据集「带偏」了——它们清一色是城市、低速、乘用车场景。论文在相关工作中直接点破:当时唯一沾点「卡车」的数据集,一个是 TuSimple(只有前视相机车道线标注),一个是 SurMine(矿场私有、仅 2D 框)。没有任何大规模、多模态、带 3D 标注的重卡感知数据集。
但重卡和乘用车完全不同,直接拿轿车数据训出来的模型上车会踩一堆坑:
| 卡车特有挑战 | 为什么轿车数据集没有 | 后果 |
|---|---|---|
| 拖车动态遮挡 | 乘用车没有可活动的挂车 | 挂车拐弯时遮挡区域实时变化,后方目标忽隐忽现 |
| 底盘-驾驶室相对运动 | 乘用车是一整块刚性体 | 传感器架在驾驶室上,过颠簸路面时驾驶室相对底盘晃动,标定易漂 |
| 传感器得架很高 | 轿车传感器离地不到 2 米 | 重卡把激光雷达架到 2.2~3.2 米,视角和轿车完全两样 |
| 物流场站环境 | 城市数据集没有集装箱堆场 | 满地金属集装箱,雷达多径反射爆炸 |
| 高速远距离决策 | 城市 50 米够用 | 重卡制动距离长,150 米外就得看清 |
一句话结论:MAN TruckScenes 就是为了补齐「重卡感知数据空白」而生——它不只把传感器搬上卡车,更把卡车独有的遮挡、运动、场站、长距离问题一次性端到学者面前。
🔧 传感器套件:把重卡武装到牙齿
MAN TruckScenes 直接基于 nuScenes 格式构建,但传感器数量和布局是为重卡重新设计的。整套配置如下(论文 Table 2):
- 相机:4 台 Sekonix SF3324,RGB,10 Hz,1928×1208,视场 120°×73°
- 激光雷达:2 台禾赛 Pandar64(10 Hz,64 线,360°×40°,200 米@10%)+ 4 台 Ouster OS0(10 Hz,64 线,360°×90°,35 米@10%),共 6 台
- 雷达:6 台大陆 ARS 548 RDI(20 Hz,76 GHz,100°×28°),这是4D 雷达
- GNSS:1 台 GeneSys ADMA-G-PRO+,100 Hz,双天线测航向,定位精度 0.01 米
- IMU:2 台 Xsens MTi-680G-SK,100 Hz,9 自由度
布局上的三个「卡车小心机」
- 两个侧置传感器模组(corner modules):左右各一组,每组含 2 相机 + 1 激光雷达 + 3 雷达。把主感知传感器分散到车身两侧,既最大化空间覆盖、又减小相对运动。
- 激光雷达架到 2.2 米(模组)和 3.2 米(车顶):高位置能减少遮挡、保护行人、防撞传感器,但也意味着视角和轿车数据集天差地别——这是论文反复强调的「novel sensor perspectives」。
- 双 IMU 分别架在底盘和驾驶室:一个测整车状态,一个测底盘-驾驶室相对运动。这正是为了补偿「驾驶室相对底盘晃动」这个卡车专属难题。
4D 雷达是最大亮点
6 台 4D 雷达拼出接近 360° 的空间覆盖(仅被挂车自身遮挡一点)。关键数字:
- 每个雷达样本平均 2600 个点,而 nuScenes 的传统雷达每帧只有约 200 个点——差了一个数量级。
- 因此 MAN TruckScenes 是第一个提供 360° 4D 雷达覆盖、且带 3D 框标注的数据集,也是目前最大的带标注雷达数据集。
关键认知:4D 雷达点云稠密到足以单独跑检测网络(论文用 RadarGNN 直接吃雷达点云),这让「纯雷达感知」「雷达-激光雷达融合」在重卡上第一次有了像样的数据支撑。
🧩 数据是怎么采、怎么标、怎么分的
采集与同步
- 从超过 25 小时行驶记录里人工挑出 747 个约 20 秒场景,覆盖高速、场站、乡村、城市,三个季节,以及雨/雾/雪、夜间/黄昏等恶劣条件。
- 时间同步用 PTP(IEEE 1588)精密时钟协议,各传感器时钟偏差小于 100 微秒,并对齐到 UTC。
- 触发同步以激光雷达为参考:先相位同步各激光雷达,再在「激光扫到图像中心」的时刻触发相机,最后错频触发雷达以减小互干扰。
- 标定四步走(外参初标 → 联合外参内标 → 航向角修正 → 数据级+应用级验证),相机-激光雷达达到像素级精度。
标注质量
- 在 2 Hz 的关键帧上人工标 3D 框,基于「融合 + 自车运动补偿」的点云。
- 标注经过最多三轮独立标注 + 质检循环,随机样本还要过双控复核。框用中心点 (x,y,z)、尺寸 (w,l,h)、四元数朝向表示。
- 27 个物体类(层级结构)、15 个属性值(5 类属性,如可见性/活动状态)、全场景34 个场景标签(分 7 大类:区域、天气、光照等)。
- 物体在整个场景里持续跟踪,带唯一 ID。
- 隐私:人脸和车牌打码、时间戳匿名化,但时间一致性保留。
数据集切分(用遗传算法找 Pareto 最优)
train / val / test 按 70% / 10% / 20% 分。但怎么分才能让各子集「既不同(测泛化)又相似(公平评测)」?论文把这个多目标优化问题用 NSGA-II 遗传算法求解:
- 目标 f1~f8:让各切分的类别分布、7 类场景标签分布偏差最小;
- 目标 f9~f10:最大化切分内时间/空间标准差;
- 目标 f11~f12:最大化切分间时间/空间的 KL 散度。
这种「用进化算法做数据集划分」的做法很工程化,值得做数据集的人抄。
🎯 支持的任务与评测
MAN TruckScenes 支持检测、跟踪、预测、定位等多种任务,但重点放在 3D 目标检测。
- 检测任务用 12 个类(从 27 标注类里挑出跨切分都存在、且标注不易混淆的子类,并新增「动物」「交通标志」两类)。
- 评测沿用 NDS,但把检测范围从 nuScenes 的 50 米放宽到 150 米,专门逼模型做长距离检测——这对高速重卡至关重要。
📊 基线实验:三种模态各自的水平
论文给了相机 / 雷达 / 激光雷达三套基线(test split,v1.0),结果如下:
| 方法 | 模态 | mAP | NDS | ATE | ASE | AOE | AVE | AAE |
|---|---|---|---|---|---|---|---|---|
| PETR(FCOS3D 预训练骨干) | 相机 | 0.02 | 0.12 | 1.13 | 0.69 | 0.65 | 1.50 | 0.56 |
| RadarGNN(6 帧聚合 4D 雷达) | 雷达 | 0.07 | 0.11 | 0.89 | 0.81 | 1.13 | 8.00 | 0.57 |
| CenterPoint(3 帧聚合激光雷达) | 激光雷达 | 0.27 | 0.41 | 0.41 | 0.35 | 0.28 | 2.73 | 0.20 |
几个有意思的观察:
- 激光雷达明显最强(NDS 0.41),但距离越远、冬天/隧道条件下质量明显下降,且对训练样本量更敏感。
- 相机在少数类和恶劣天气/光照下很吃力(mAP 仅 0.02),基本不可用。
- 雷达对所有非金属类都不行(金属反光才好),且在隧道、集装箱场站里被多径反射坑惨(AVE 高达 8.00,速度误差爆炸)。
- 总体结论:重卡的安全运行还需要更鲁棒的长距离感知,单一模态都不够。这其实是在喊话「该上多模态融合 / 端到端融合」了。
⚖️ 和本博客另一篇 TruckDrive 怎么比
我之前写过 TruckDrive 精读(CVPR 2026,Torc × 普林斯顿),它和 MAN TruckScenes 是「重卡数据集双子星」,但取向不同:
| 维度 | MAN TruckScenes | TruckDrive |
|---|---|---|
| 发表 | NeurIPS 2024 D&B | CVPR 2026 |
| 传感器 | 4 相机 + 6 激光雷达 + 6 个 4D 雷达 | 7 长距 FMCW 激光雷达 + 10 个 4D 雷达 + 11~15 相机 |
| 标注范围 | 3D 框到约 226 米 | 3D 框到 400 米、2D 到 1000 米 |
| 最大亮点 | 首个 360° 4D 雷达带标注 + nuScenes 格式 devkit | 把长距离边界推到极致,证明 150 米外模型就「瞎」 |
| 场景 | 高速 + 场站 + 城乡 + 三季 + 恶劣天气 | 高速 hub-to-hub 为主 |
| 格式 | nuScenes 格式(易迁移) | 自有格式 |
两者互补:MAN 胜在「模态全、格式友好、雷达稠密」,TruckDrive 胜在「距离更远、长距压力测试更狠」。做重卡感知/端到端的人,两个都该下。
🚧 局限(论文自己承认的)
- 只有感知,没有规划/控制标注:它是感知数据集,不含端到端驾驶动作或闭环规划评测(不像 nuPlan)。想练重卡端到端规划得另找数据。
- 样本量仍偏小:747 场景、约 3 万带标关键帧,和 nuScenes(4 万关键帧)接近但远小于 Waymo(23 万)。
- 雷达标定只靠摄影测量,角误差可能到 0.03°、内部错位无法完全排除;相机内参在图像边缘不确定性增大。
- 地理覆盖集中德国:虽然比很多数据集大(约 100 km²),但域外泛化仍待验证。
- 许可证 CC BY-NC-SA 4.0:非商业,工业直接拿来训练卖钱的产品要注意合规。
💡 个人思考(站在 VLA / 端到端视角)
作为做重卡端到端驾驶的工程师,我对 MAN TruckScenes 最兴奋的有三点:
- nuScenes 格式 = 零成本迁移。我们现有的 BEV / 检测 / 端到端代码几乎能直接吃这份数据,把「卡车视角」作为新域做预训练或域适应,成本极低。
- 4D 雷达点云是融合的金矿。激光雷达在雨雾掉点、相机在夜间瞎,但 4D 雷达又密又能测速——把它作为端到端模型的独立 token 流(而非后融合),很可能显著提升恶劣天气下的重卡安全率。这正是我们「重卡安全」系列(TruckDrive / TruckV2X / CargoLoad-RSS / AntiRollover-APF)一直关心的落点。
- 150 米评测范围点出了真问题。我们 Flow-GRPO 类的扩散规划在长尾/远距场景下也容易「看不见就乱开」,而 MAN 的基线已经用数据证明:单模态在 150 米外基本失效。下一步值得做的是「用 MAN 的远距离标注训感知 + 用扩散规划做长视界决策」的组合。
一句话收尾:MAN TruckScenes 不是又一个「换个车的数据集」,而是第一次把重卡的**物理结构难题(拖车遮挡、高视角、底盘-驾驶室运动)和工况难题(场站、雨雾、夜间、长距离)**系统性地交到社区手里。对想做重卡端到端的人,它是绕不开的起跑线。
📚 参考资料
- 论文 arXiv:2407.07462
- NeurIPS 2024 官方页:Proceedings
- Devkit:github.com/TUMFTM/truckscenes-devkit
- AWS Open Data:registry.opendata.aws/man-truckscenes
- 本博客相关:TruckDrive 精读、TruckV2X 精读、CargoLoad-RSS 精读、AntiRollover-APF 精读