不同传感器前中后融合方案简介

📅 2026/8/14 15:30:30
不同传感器前中后融合方案简介
声明本文主要参考开源资料进行学习整理如有错漏欢迎评论交流~在自动驾驶场景下摄像头 激光雷达的传感器融合方案是最常见的感知技术路线目标是充分利用二者的互补性摄像头优势分辨率高、纹理丰富、颜色信息齐全有利于识别语义信息车道线、交通灯、行人类别等。激光雷达优势天然地具有深度信息直接测得高精度距离和稠密点云有利于构建 3D 几何结构和检测障碍物。融合方式大致分为三类前融合、中融合、后融合。1. 前融合前融合是指把各个传感器的数据采集后经过数据同步后对这些原始数据进行融合因此也称为数据级融合。将摄像头图像与激光雷达点云在几何空间对齐例如把 3D LiDAR点云投影到2D图像上 然后检查点云是否属于2D边界框。前融合展示如下图前融合可以从整体上来处理信息让数据更早做融合整体处理信息让数据更有关联性把激光雷达点云和摄像头像素级数据进行融合信息损失比较少但前融合也会存在一些问题例如点云数据和像素数据坐标系不同直接融合效果差需要处理的数据量大对算力要求较高对融合策略要求也比较高目前业内应用的比较少。2. 后融合后融合是指摄像头和激光雷达等各传感器独立完成感知任务如检测、分割最后在结果层面进行融合如加权IOU匹配等因此也称之为目标级融合。例如可以将摄像头的2D边界框投影到3D边界框然后将这些边界框与LiDAR检测过程中获得的边界框进行融合。后融合的优点是传感器独立识别解耦性好易于扩展。缺点是会损失中间信息影响精度rule-based 融合规则有局限性难以充分利用跨模态互补信息。后融合展示如下图3. 中融合中融合是指先将各个传感器通过神经网络模型提取中间层特征即有效特征再融合有效主要特征也称为特征级融合典型的是对有效特征在 BEV 空间进行融合。相比于前融合与后融合在BEV空间进行中融合有如下优点跨摄像头融合和多模融合更容易实现因为统一了数据空间不需要处理规则关联不同传感器的感知结果算法实现更加简单可以很容易地融合时序信息形成4D空间感知网络可以更好地实现一些感知任务如测速等可“脑补”出被遮挡区域目标在BEV空间给予先验知识对被遮挡的区域进行预测感知和预测在统一空间(BEV空间)内完成可以通过神经网络直接做端到端优化并行出结果既可以避免误差累积也可以减少人工逻辑让感知网络通过数据驱动的方式自学习从而更好地实现功能迭代。目前使用最多的是中融合方案。4. BEVFusionBEVFusion是典型的中融合方法将来自相机和LiDAR的原始输入编码到同一个BEV空间。如下图所示BEVFusion主要由相机流、激光雷达流、动态融合模块和检测头组成分别简单看下相机流将多视角图像转到BEV空间由图像编码器、视觉投影模块、BEV编码器组成。图像编码器旨在将输入图像编码为语义信息丰富的深度特征它由用于基本特征提取的2D backbone和用于多尺度特征提取的FPN组成并采用了一个简单的功能自适应模块ADP来完善上采样功能如下图所示视觉投影模块采用 LSS将图像特征转换到自车坐标系的 3D 表示。该方法以图像视图为输入通过离散分类的方式密集预测深度随后结合相机外参与预测深度生成伪体素表示。BEV编码模块采用空间到通道S2C操作将4D伪体素特征编码到3D BEV空间从而保留语义信息并降低成本。然后使用四个3 × 3卷积层缩小通道维度并提取高级语义信息。动态融合模块的作用是将concat后的 相机、 LiDAR的 BEV特 进行有效融合BEVFusion应用一个简单的通道注意力模块来选择重要的融合特征网络结构图如下所示LiDAR流将激光雷达点转换为BEV空间BEVFusion采用3种流行的方法PointPillars、CenterPoint和TransFusion 作为激光雷达流从而展示模型框架的优秀泛化能力。