上篇聊了点云分割的几种经典方法——RANSAC去地面、欧式聚类、区域生长。这些方法处理的是3D数据但机器人感知世界不只有激光雷达视觉传感器同样重要甚至在很多场景下信息量更丰富。今天从相机成像原理开始讲起。这是计算机视觉的基础面试中几乎必考。不管你是做SLAM、做目标检测还是做3D重建都得先搞明白相机是怎么把三维世界投影到二维图像上的。小孔成像模型相机成像最基础的模型就是小孔成像Pinhole Camera Model。想象一个完全黑暗的盒子前面戳一个小孔光线通过小孔在后面的成像平面上形成倒立的实像。这就是最原始的相机。小孔模型的核心公式很简单x f * X / Z y f * Y / Z其中(X, Y, Z)是三维空间中某个点在相机坐标系下的坐标(x, y)是它在成像平面上的投影坐标f是焦距小孔到成像平面的距离。这个公式背后的直觉很清晰Z越大点越远投影到成像平面上的x和y就越靠近中心——这就是近大远小的数学表达。但实际图像处理中我们用像素坐标而不是物理坐标毫米。所以需要把物理坐标转换成像素坐标这就引入了像素坐标系和内参矩阵[u] [fx s cx] [X/Z] [v] [0 fy cy] [Y/Z] [1] [0 0 1] [ 1 ]这就是相机内参矩阵K。fx和fy是焦距以像素为单位等于物理焦距除以像素尺寸cx和cy是主点坐标光轴与成像平面的交点通常接近图像中心s是倾斜因子描述像素不是严格矩形的程度大多数相机s0。面试时候这个公式必须脱口而出。内参矩阵描述的是相机自身的几何特性跟相机在外面的位置姿态无关。只要不换镜头、不调整焦距内参就是固定的。import numpy as np # 典型的相机内参矩阵以1280x720分辨率为例 fx, fy 718.8560, 718.8560 # 焦距像素单位 cx, cy 607.1928, 185.2157 # 主点坐标 K np.array([ [fx, 0, cx], [ 0, fy, cy], [ 0, 0, 1] ]) # 世界坐标到像素坐标的投影 def project_to_image(point_3d, K, R, t): 将3D点投影到图像平面 # 先变换到相机坐标系 p_cam R point_3d t # 投影到像素坐标 p_proj K p_cam p_proj p_proj / p_proj[2] # 归一化除以深度 return p_proj[:2]有个面试常考的延伸问题为什么内参矩阵是3x3而不是4x4因为内参做的是从3D到2D的投影这个过程中深度信息被丢弃了除以Z。这是一个不可逆的过程——你无法从一张图片恢复深度信息单目情况下。这也是为什么我们需要双目、RGB-D或者激光雷达来获取深度。还有一个容易混淆的点焦距f和视场角FOV的关系。对于给定的传感器宽度w和焦距f水平视场角FOV 2 * arctan(w / (2*f))。焦距越大视场角越小看得越远但范围越窄——这就是长焦镜头和广角镜头的区别。镜头畸变小孔模型是理想化的实际镜头存在畸变。畸变会让直线在图像中变成曲线影响测量精度。畸变分两种主要类型径向畸变Radial Distortion由镜头形状引起越靠近图像边缘畸变越大。桶形畸变barrel distortion让直线向外弯曲常见于广角镜头枕形畸变pincushion distortion让直线向内弯曲常见于长焦镜头。数学模型通常用多项式表示x_distorted x * (1 k1*r² k2*r⁴ k3*r⁶) y_distorted y * (1 k1*r² k2*r⁴ k3*r⁶)其中r是点到图像中心的距离k1、k2、k3是径向畸变系数。一般用k1和k2就够了只有鱼眼镜头等广角镜头才需要k3。切向畸变Tangential Distortion由镜头和成像平面不完全平行引起安装误差。用两个参数p1、p2描述x_distorted x (2*p1*x*y p2*(r² 2*x²)) y_distorted y (p1*(r² 2*y²) 2*p2*x*y)五个畸变参数(k1, k2, p1, p2, k3)加上四个内参(fx, fy, cx, cy)一共九个参数就是相机标定要求解的全部内容倾斜因子s通常设为0。面试时候经常被问怎么判断一张图片有没有畸变最简单的办法是看图片中的直线——如果现实中的直线在图像中弯曲了那就是有畸变。桶形畸变让直线向外凸枕形畸变让直线向内凹。外参矩阵与坐标系变换内参描述相机自身的几何特性外参描述相机在世界坐标系中的位置和姿态。外参是一个3x3旋转矩阵R和一个3x1平移向量t合起来就是[R|t]一个3x4的矩阵。一个3D点从世界坐标系到图像像素坐标的完整投影过程是p_image K * [R | t] * P_world其中K是3x3内参矩阵[R|t]是3x4外参矩阵P_world是3D点的齐次坐标。理解相机成像需要理清几个坐标系之间的关系世界坐标系World Frame全局参考系描述所有物体的绝对位置。在机器人领域通常用map或world表示。相机坐标系Camera Frame以相机光心为原点Z轴指向拍摄方向X轴向右Y轴向下OpenCV约定。注意不同框架的约定可能不同比如ROS中相机坐标系是X右Y下Z前而OpenGL是X右Y上Z后。图像物理坐标系成像平面上的物理坐标原点在光轴与成像平面的交点主点单位是毫米。像素坐标系以图像左上角为原点u向右v向下单位是像素。这是我们在代码中实际使用的坐标系。从世界坐标系到像素坐标系的变换链是世界坐标 →外参R,t→ 相机坐标 →内参K→ 像素坐标。这个变换链在SLAM、视觉里程计、手眼标定等任务中反复出现。理解它是理解整个视觉几何的基础。面试时候经常问的一个问题是给定一张图片和对应的相机位姿怎么把3D模型渲染到图片上答案就是用这个投影公式把3D模型的每个点先通过外参变换到相机坐标系再通过内参投影到像素坐标。AR增强现实的核心就是这个过程。面试中怎么聊面试官问相机成像原理你可以按这个顺序回答先说小孔模型和投影公式再说内参矩阵的物理含义和各参数的意义然后讲镜头畸变的两种类型和数学模型最后说外参和坐标系变换链。如果面试官追问为什么需要相机标定你可以说因为内参和畸变参数是相机自身的属性每台相机、每个镜头组合都不一样必须通过标定来获取。标定之后才能做精确的测量和重建否则像素坐标和真实世界坐标之间的映射关系是不准确的。如果面试官追问单目相机能测深度吗你可以说单目相机本身无法直接测量深度因为投影过程丢失了深度信息。但可以通过一些间接方法估计深度比如已知物体大小的先验、运动视差Structure from Motion、或者用深度学习方法从单张图片预测深度。不过这些方法都有局限性精度和鲁棒性远不如双目或RGB-D相机。补充一个实际项目中容易踩的坑相机坐标系约定不一致的问题。OpenCV的相机坐标系是X右Y下Z前Z轴指向拍摄方向而ROS的相机坐标系是X右Y下Z前和OpenCV一致但OpenGL是X右Y上Z后。如果你在做AR或者3D渲染需要把OpenGL的坐标系转换到OpenCV的坐标系只需要把Y和Z取反。我有一次做相机和IMU的联合标定标定结果一直不对最后发现是IMU的坐标系和相机的坐标系手性不同一个是右手系一个是左手系加了一个坐标轴翻转就解决了。面试时候提到这种坐标系踩坑经验面试官会觉得你确实做过实际项目。下一篇讲相机标定的实操流程——怎么用OpenCV做棋盘格标定获取内参和畸变系数。如果这篇文章对你有帮助欢迎点赞、在看、转发三连。 你的支持是我持续更新的最大动力。「机器人软件开发面试·从入门到精通」连载系列上一篇第150篇 激光雷达点云分割——地面分离、聚类分析和物体提取 下一篇预告第152篇 相机标定实操——内参/外参/畸变系数的标定流程有任何问题欢迎评论区留言我会尽量回复。