Simple-BEV几何工具库utils/geom详解:坐标系变换约定与4x4矩阵运算新手完全指南

📅 2026/8/22 14:31:38
Simple-BEV几何工具库utils/geom详解:坐标系变换约定与4x4矩阵运算新手完全指南
Simple-BEV几何工具库utils/geom详解坐标系变换约定与4x4矩阵运算新手完全指南【免费下载链接】simple_bevA Simple Baseline for BEV Perception项目地址: https://gitcode.com/gh_mirrors/si/simple_bevSimple-BEV 是一个知名的多传感器 BEV鸟瞰图感知基线项目其 utils/geom.py 几何工具库用不到 300 行代码集中实现了自动驾驶感知中最核心的坐标系变换约定与 4x4 矩阵运算。读完本文你将轻松掌握a_T_b变换命名约定、齐次矩阵求逆、点云批量变换和相机内外参操作再也不怕读不懂 BEV 感知代码里的几何部分。 先搞懂坐标系变换约定a_T_b到底怎么读Simple-BEV 全项目统一使用一套简洁的几何命名约定这是读懂 utils/geom.py 一切函数的前提。项目文档README 中的Geometry conventions一节定义了两条规则记号含义p_a点p位于坐标系a中a_T_b把点从坐标系b变换到坐标系a的 4x4 矩阵于是变换关系写成p_a a_T_b * p_b链条式变换也因此变得直观例如把激光雷达下的点变换到某个相机xyz_cam0 cam0_T_cam1 * cam1_T_velodyne * xyz_velodyne新手记忆口诀读法从右往左下标指向出发坐标系。此外项目采用固定轴向约定Z 轴向前深度方向、Y 轴向下、X 轴向右。因此图像左上角是 0,0坐标向右、向下递增。这个约定贯穿了所有张量的轴顺序B,S,C,Z,Y,X。 4x4 齐次矩阵旋转 平移一步到位BEV 感知里几乎所有位姿都用 4x4 齐次矩阵表示左上 3x3 是旋转R右列 3x1 是平移t最后一行固定为[0,0,0,1]。utils/geom.py提供了配套的拆与装工具函数作用典型形状eye_4x4(B)生成 B 个单位 4x4 矩阵B x 4 x 4split_rt(rt)从 4x4 拆出旋转r和平移t输入B x 4 x 4merge_rt(r, t)由旋转和平移合成 4x4输出B x 4 x 4merge_rtlist(rlist, tlist)批量版本处理多相机场景输入B x N x 3 x 3在 nuscenesdataset.py 中数据集加载时正是这样组装外参的先用merge_rt(rots, trans)得到velo_T_cam相机到激光雷达紧接着求逆得到cam_T_velo——这就是a_T_b约定在真实代码中的最小使用闭环。⚡ safe_inverse不花算力求矩阵逆的巧思常规 4x4 求逆开销不小而刚体变换矩阵有一个数学特性旋转部分的逆就是转置旋转矩阵是正交矩阵。所以 utils/geom.py 中的safe_inverse只用两步就完成求逆旋转部分直接转置R⁻¹ Rᵀ平移部分按公式t⁻¹ -Rᵀ * t计算。这样避开了通用求逆的除法与高斯消元速度快且数值稳定。项目中两种规模都有覆盖safe_inverse(a)批量版处理B x 4 x 4是训练推理热路径的主力safe_inverse_single(a)单矩阵版内部复用split_rt_single拆开旋转与平移再重组。在 eval_nuscenes.py 评估脚本里你能看到最典型的组合拳velo_T_cams merge_rtlist(rots, trans)→cams_T_velo safe_inverse(velo_T_cams)拿到cams_T_velo后所有激光雷达点、雷达点、目标框都可以一次性搬到任意相机坐标系下。 apply_4x4把点云批量送入任意坐标系utils/geom.py 的apply_4x4(RT, xyz)是出现频率最高的函数之一它做三件事给B x N x 3的点云追加一行 1补齐为齐次坐标转置后与B x 4 x 4矩阵做批量矩阵乘法B x 4 x 4对B x 4 x N取回前 3 维输出变换后的点云。注意它没有做透视除法第 39 行被注释掉了因为该函数只用于刚体间如相机↔雷达、相机↔相机的位姿变换分母恒为 1。而在 utils/vox.py 的体素化模块中apply_4x4被用来在不同参考帧之间搬运记忆体素memory voxel是时序融合的几何基础。 相机内参把 4x4 当成内参的妙用项目里内参矩阵pix_T_cam也统一成 4x4 形状只是前 3x3 放内参好处是内参和外参可以无缝串联矩阵乘法完全遵守同一套a_T_b约定。配套函数有split_intrinsics(K)拆出焦距fx, fy与主点x0, y0merge_intrinsics(fx, fy, x0, y0)反向组装回 4x4scale_intrinsics(K, sx, sy)图像缩放时同步缩放内参训练时res_scale降采样就靠它见 nuscenesdataset.py。 19维 lrtlist目标框的打包格式Simple-BEV 用一个B x N x 19张量同时存下目标框的全部信息这是 nets/liftnet.py 等网络的核心输出格式维度内容前 3 维尺寸l, r, t长、宽、高后 16 维4x4 位姿矩阵中心位置 朝向围绕它的工具链非常完整split_lrtlist/merge_lrtlist19 维 ↔ 尺寸 4x4 互转apply_4x4_to_lrtlist整个目标框列表变换坐标系内部就是矩阵相乘rtlist_Y Y_T_X * rtlist_X尺寸保持不变尺寸是各向同性长度与位姿无关get_xyzlist_from_lrtlist由尺寸生成 8 个角点再变换到相机系——nuscenesdataset.py 用它计算 3D 框在图像中的投影get_clist_from_lrtlist取出每个框的中心点。 像素 ↔ 相机 与角度回卷utils/geom.py还覆盖了 BEV 管线中2D 图像空间 ↔ 3D 相机空间的转换函数方向用途xyd2pointcloud像素深度 → 3D 点云Lift-Splat 网络把深度图抬升为点云nets/liftnet2.py 核心步骤pixels2camera像素坐标 → 相机坐标逐像素反投影公式x_cam z/fx * (x - x0)camera2pixels相机坐标 → 像素坐标投影nets/bevformernet.py 用它把 BEV 特征点投回各相机图像另外wrap2pi(rad_angle)通过atan2(sin(a), cos(a))把任意角度回卷到[-π, π]避免朝向角越界——nuscenesdataset.py 里解析 GT 朝向时就用到了它。️ 动手路线图在哪里能实战这些工具建议按下面的路径在项目里追踪utils/geom的调用把约定和函数串成完整记忆nuscenesdataset.py —— 数据加载内参缩放、外参组装与求逆、GT 框解析与投影是约定入门的最佳样本utils/vox.py —— 体素工具apply_4x4在记忆体素坐标系间的搬运nets/liftnet.py / nets/liftnet2.py —— 核心网络深度反投影成点云、lrtlist的生成与变换nets/bevformernet.py —— 查询投影BEV 特征点投回各相机做可变形注意力eval_nuscenes.py / eval_lyft.py —— 评估脚本多传感器外参统一变换的完整示例。总结utils/geom.py虽短却是 Simple-BEV 全部几何逻辑的地基。抓住三个要点即可举一反三——a_T_b的下标即出发点读法、刚体矩阵转置公式的快速求逆、以及内参外参统一的 4x4 齐次表示。掌握它们你就能流畅阅读任何基于该约定的 BEV 感知项目了。【免费下载链接】simple_bevA Simple Baseline for BEV Perception项目地址: https://gitcode.com/gh_mirrors/si/simple_bev创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考