EmbodiedScan论文精读:5000+扫描、100万视图、760+类别的3D感知数据集是怎样炼成的

📅 2026/8/21 13:38:57
EmbodiedScan论文精读:5000+扫描、100万视图、760+类别的3D感知数据集是怎样炼成的
EmbodiedScan论文精读5000扫描、100万视图、760类别的3D感知数据集是怎样炼成的【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScan一句话看懂EmbodiedScan 是一个面向具身智能Embodied AI的多模态 3D 感知数据集与基准收录了 5000 真实室内扫描、100 万张自我中心 RGB-D 视图、100 万条语言提示、16 万 3D 目标框和 760 类别标注来自 CVPR 2024 与 NeurIPS 2024 的官方开源工作。如果你接触过 3D 视觉一定对 ScanNet 不陌生——但它只有 20 类、单视角输入离让机器人像人一样在房间里看、听、说还很远。EmbodiedScan 要填的正是这个坑让模型在第一人称视角下同时完成 3D 检测、视觉定位和占用预测。这篇论文精读会从数据采集、标注流程、评测任务到基线框架把这份数据大餐是怎么炼成的讲清楚。为什么需要 EmbodiedScan 这样的 3D 感知数据集传统的 3D 场景理解研究几乎都建立在全局视角之上给模型一整栋房间的完整点云让它输出场景里所有物体的框。但真实的机器人/具身智能体只有第一人称视角——它看到的是一帧帧连续的 RGB-D 画面需要在边走边看中理解环境并把理解结果转化成语言与人交互。EmbodiedScan 的三大创新点全部围绕这个 gap 展开自我中心视角Ego-Centric数据以第一人称 RGB-D 序列为主贴近真实机器人感知方式多模态对齐同一场景同时提供 RGB 图像、深度图、点云和自然语言描述天然支持看图说话定位大规模长尾类别760 类别部分与 LVIS 对齐远超 ScanNet 的 20 类考验模型对细粒度物体的识别能力。上图可以直观看到数据集的核心卖点传统工作左上依赖全局渲染而 EmbodiedScan 用真实采集的多帧 RGB-D 序列右上配合语言提示完成多模态 3D 感知右下。5000 扫描是怎样采集的四大源数据集融合EmbodiedScan 不自己拿扫描仪重新采一遍而是站在巨人的肩膀上——它整合了四个公开室内数据集统一标注、统一格式源数据集特点在 EmbodiedScan 中的角色ScanNet经典室内 RGB-D 重建数据集主体数据来源之一3RScan多时序、多视角室内扫描补充动态场景与视角多样性Matterport3D全景相机采集的室内空间补充大规模、多房间场景ARKitScenes苹果 AR 设备采集的深度序列补充真实 AR 传感器数据融合后得到的数据规模相当可观5k 扫描、100 万张自我中心视图、160k 实例框、760 类别此外还有 80 类的密集语义占用Occupancy标注。原始数据的下载与组织方式官方在 data/README.md 中给出了详细指南——每个源数据都有自己的目录结构约定比如scannet/scans/scene_id、3rscan/scene_id/sequence等。值得注意的是不同源数据的深度尺度并不一致代码在加载时会做针对性处理例如 Matterport3D 的depth_shift设为 4000其余为 1000这一细节可以在数据集 API embodiedscan_dataset.py 中看到。数据标注的硬核细节16 万实例框与 100 万语言提示数据量只是门槛标注质量才是真正决定数据集价值的东西。EmbodiedScan 在标注上有几个值得品味的细节1. 9-DoF 的欧拉角深度3D 框传统 3D 数据集多用轴对齐框Axis-Aligned而 EmbodiedScan 采用Euler-Depth格式以欧拉角表达朝向、以深度表达尺寸支持任意朝向的 9 自由度 3D 框能更准确地框住斜着放的沙发这类物体。这个设计贯穿整个代码库从 euler_depth_box3d.py 到各个检测器配置都能看到它的身影。2. 基于 SUSTechPOINTS 的定制标注工具16 万实例框不是手工硬描出来的团队基于开源标注框架 SUSTechPOINTS 开发了定制工具支持在点云图像联动视图下高效标注这也是能覆盖 760 长尾类别的前提。3. 100 万条语言提示从简单指令到复杂指令语言提示的生成参考了 ReferIt3D 中 SR3D 的做法。为了让提示更贴近真实交互数据集里既有Find the chair这类简单提示也有Find the table that is closer to the counter这类复杂空间关系提示——后者对模型的空间推理能力提出了更高要求也是评测中拉开差距的关键详见论文中 complex prompts 对性能的影响分析。三大评测任务与基线成绩基于这份数据作者搭建了三类评测任务每一类都给出了官方基线任务配置示例官方基线成绩多视图 3D 目标检测mv-det3d_8xb4_embodiedscan-3d-284class-9dof.pyAP0.25 15.22连续 3D 目标检测cont-det3d_8xb1_embodiedscan-3d-284class-9dof.pyAP0.25 17.83多视图 3D 视觉定位mv-grounding_8xb12_embodiedscan-vg-9dof-full.pyAP0.25 36.78多视图占用预测mv-occ_8xb1_embodiedscan-occ-80class.pymIoU 21.28连续占用预测cont-occ_8xb1_embodiedscan-occ-80class.pymIoU 22.92这些基线成绩看起来不高是因为类别数多达 284 类评测用类别远超传统数据集难度天然更高。官方还发现加入复杂语言提示训练后视觉定位的 AP 能从 36.78 提升到 39.26说明多模态数据的质比量更能带动模型能力。Embodied Perceptron官方基线框架怎么吃下这些数据与数据集配套发布的基线框架叫Embodied Perceptron核心思想是任意数量多模态输入统一特征空间多任务输出。它的处理流程可以拆成四步3D 分支用 Sparse 3D Encoder基于 MinkowskiEngine 的稀疏卷积见 mink_resnet.py处理点云生成体素特征2D 分支用 2D Image Encoder 逐帧提取 RGB 图像特征文本分支用 Text Encoder 编码自然语言提示多模态融合通过点级特征融合point_fusion.py把 2D 特征投影到 3D 空间再与文本特征对齐最终由不同解码头输出检测框、占用图和定位结果。三种任务分别对应三个检测器实现连续 3D 检测用 embodied_det3d.py视觉定位用 sparse_featfusion_grounder.py占用预测用 embodied_occ.py。多视图版本则依赖 multiview.py 中的数据变换来组织任意数量的视图输入。如何快速上手体验如果你想把这份数据集跑起来官方提供了完整的工具链一键安装执行python install.py all即可安装全部依赖注意 MinkowskiEngine 和 PyTorch3D 可能需要单独处理训练与测试用 tools/train.py 和 tools/test.py 配合configs/下的各类配置文件即可例如单卡训练多视图 3D 检测只需要一条命令指定配置文件数据转换converter/ 目录下的脚本负责从原始.sens文件等格式中提取图像和占用标注探索数据explorer.py 提供了数据集浏览工具demo/demo.ipynb 则是一个开箱即用的演示 notebook可以在样例扫描上直接跑推理并可视化结果。总结EmbodiedScan 带来了什么一句话总结这份论文精读EmbodiedScan 用真实扫描 第一人称视角 多模态对齐 长尾类别重新定义了 3D 感知数据集的标准。它不只是把四个数据集拼在一起而是通过统一的 9-DoF 标注格式、百万级语言提示和三大评测任务把3D 场景理解从学术设定推向具身智能可落地的感知底座。后续官方还推出了层级语言标注更丰富的 MMScan同样收录在本仓库值得持续关注。对刚入门 3D 视觉或具身智能的读者建议按数据准备 → 跑通 demo → 复现基线 → 尝试新任务的顺序学习这份仓库几乎把每一步的坑都提前填好了。【免费下载链接】EmbodiedScan[CVPR 2024 NeurIPS 2024] EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI项目地址: https://gitcode.com/gh_mirrors/em/EmbodiedScan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考