OpenLane-V2 数据集详解:subset_A与subset_B的选择与使用策略

📅 2026/8/18 15:45:02
OpenLane-V2 数据集详解:subset_A与subset_B的选择与使用策略
OpenLane-V2 数据集详解subset_A与subset_B的选择与使用策略【免费下载链接】OpenLane-V2[NeurIPS 2023 Track Datasets and Benchmarks] OpenLane-V2: The First Perception and Reasoning Benchmark for Road Driving项目地址: https://gitcode.com/gh_mirrors/op/OpenLane-V2OpenLane-V2 是业界首个面向自动驾驶场景结构感知与推理的开源数据集NeurIPS 2023 Track Datasets and Benchmarks它同时提供车道中心线、交通要素与拓扑关系标注并划分为 subset_A 与 subset_B 两套子集。很多新手在下载 OpenLane-V2 数据集时都会困惑这两套子集到底有什么区别训练该用哪一套能否混用本文将从数据规模、任务定义、下载方式与使用策略四个维度帮你一次搞懂 subset_A 与 subset_B 的选择问题。OpenLane-V2 数据集是什么自动驾驶场景结构推理标杆简单来说OpenLane-V2 数据集解决的是车道拓扑推理问题给定环视相机图像模型不仅要检测出车道和交通要素红绿灯、路牌还要推理出它们之间的拓扑关系——车道与车道是否连通、某个红绿灯管辖哪条车道。相比 OpenLane-V1 只做 3D 车道线检测OpenLane-V2 数据集把任务升级为感知 推理两步走这也是它被 NeurIPS 2023 收录的重要原因。围绕它还举办了 CVPR 2023 OpenLane Topology 挑战赛与 CVPR 2024 Mapless Driving 大赛并配套提供了完整的 devkit 与基线模型代码。subset_A 与 subset_B 的核心区别数据来源与规模对比OpenLane-V2 数据集由两个独立子集组成它们采集自不同的原始数据集互不重叠对比维度subset_Asubset_B原始数据来源Argoverse 2nuScenes发布状态主力子集v2.0 首发2023/08 补充发布训练集规模700 段 / 约 2.2 万帧696 段 / 约 2.8 万帧验证 / 测试集各 150 段各 150 段标注信息info约 8.8G约 7.7G图像总量约 120G8 个分卷约 20G7 个分卷主要用途挑战赛、排行榜泛化能力测试使用限制禁止使用外部数据训练可配合 subset_A 做泛化验证需要特别注意subset_A 作为官方主力的 subset挑战赛和排行榜明确规定不允许使用任何外部数据包括 subset_B训练模型这一点在 getting_started 中有明确说明。具体到每一帧subset_A 与 subset_B 的标注格式完全一致都包含以下字段lane_centerline3D 车道中心线、traffic_element交通要素及红绿灯属性、topology_lclc车道间邻接矩阵、topology_lcte车道与交通要素间邻接矩阵字段细节可参考 annotation 与 data 目录说明。如何选择 subset_A 与 subset_B3 种典型使用策略策略一参赛刷榜 → 只用 subset_A如果你要参加 OpenLane Topology 挑战赛或冲击排行榜请直接使用 subset_A。训练时严格只用 subset_A 的 train 集验证用 subset_A 的 val 集测试集提交到官方服务器。目录下的data_dict_subset_A.json已经帮你划分好了 train / val / test 三段。策略二验证泛化能力 → subset_A 训练 subset_B 测试这是官方推荐的做法用 subset_A 训练模型再在 subset_B 的 val 集上评估。由于两套子集来自不同的城市与采集设备如果模型在 subset_B 上依然表现良好说明其泛化能力过硬而非仅仅记住了 subset_A 的分布。分布统计数据可参考 statistics。策略三科研探索 → 搭配 Map Element Bucket 使用在 v2.0 中官方为 subset_A 额外发布了Map Element Bucket约 240M把车道标注升级为更精细的lane_segment含左右车道线、虚实线类型、路口标志以及行人横道、道路边界等area元素配套的拓扑矩阵也变为topology_lsls与topology_lste。研究无高精地图驾驶Mapless Driving方向的同学建议以 lane segment 为研究对象这也是 ICLR 2024 LaneSegNet 论文采用的表示方式。数据下载与目录结构5 分钟快速上手首先克隆代码仓库含 devkit 与预处理脚本git clone https://gitcode.com/gh_mirrors/op/OpenLane-V2 cd OpenLane-V2 conda create -n openlanev2 python3.8 -y conda activate openlanev2 pip install -r requirements.txt python setup.py develop数据集本体info、图像、SD Map需要从官方提供的网盘按分卷下载新手建议先下载sample 示例数据约 300M快速体验流程确认没问题后再下载完整子集。下载后按如下目录结构放置OpenLane-V2/ ├── train|val|test/[segment_id]/ │ ├── image/[camera]/[timestamp].jpg # 环视图像 │ ├── sdmap.json # SD 地图可选 │ └── info/[timestamp].json # 标注与元数据 ├── data_dict_subset_A.json # subset_A 划分 ├── data_dict_subset_B.json # subset_B 划分 └── preprocess.py / preprocess-ls.py # 预处理脚本数据预处理与评测从原始 JSON 到可直接训练原始标注是逐帧 JSON训练前需预处理成 pickle 集合文件命令在data/OpenLane-V2/目录下执行cd data python OpenLane-V2/preprocess.py # 生成 OpenLane Topology 任务数据 python OpenLane-V2/preprocess-ls.py # 生成 lane segmentMap Element Bucket数据预处理脚本会读取data_dict_subset_A.json或data_dict_subset_B.json的划分产出data_dict_subset_A_train.pkl等文件。评测时官方以OpenLane-V2 ScoreOLS衡量 OpenLane Topology 任务、以OpenLane-V2 UniScoreOLUS衡量 Driving Scene Topology 任务两者都是检测精度mAP与拓扑 mAP 的加权平均公式见 metrics。提交前建议先用 val 集跑一遍本地评估from openlanev2.lanesegment.evaluation.evaluate import evaluate metrics evaluate( ground_truthdata/OpenLane-V2/data_dict_subset_A_val_ls.pkl, predictionspath/to/submission.pkl ) print(metrics)常见误区与避坑建议❌混用子集训练挑战赛规则禁止在 subset_A 训练中使用 subset_B否则成绩无效。⚠️许可协议使用本数据集前需同意 nuScenes 与 Argoverse 2 的条款数据集遵循 CC BY-NC-SA 4.0。版本差异v1.x 与 v2.x 在 lane segment 与 SD Map 的 API 上有所不同且 vx.1 版本更新了评估指标官方推荐优先使用 vx.1 指标与 devkit。基线起步想快速复现效果可直接使用官方基线模型plugin/models/baseline基于 mmdetection3d 构建修改configs/baseline.py即可训练与评估。总体而言参赛刷榜选 subset_A验证泛化加 subset_B研究拓扑推理看 Map Element Bucket——这就是 OpenLane-V2 数据集最稳妥的选择与使用策略。希望这篇指南能帮你少走弯路顺利跑通你的第一个自动驾驶感知模型【免费下载链接】OpenLane-V2[NeurIPS 2023 Track Datasets and Benchmarks] OpenLane-V2: The First Perception and Reasoning Benchmark for Road Driving项目地址: https://gitcode.com/gh_mirrors/op/OpenLane-V2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考