SIFT 的变体与发展 📅 2026/7/20 16:00:14 在前两篇的内容里我们已经知道从 DoG 尺度空间开始到关键点检测、亚像素定位、方向分配再到 128 维描述子的构建和最终匹配SIFT 建立了一套完整且高度系统化的局部特征提取管道。解决了局部特征中的多个核心问题如尺度不变性、旋转不变性和一定程度上的光照变化鲁棒性等。直今SIFT 依然是评价局部特征算法的重要基准之一。但没有完美的算法随着应用场景越来越复杂人们发现 SIFT 仍然存在一些明显的不足问题 影响计算速度较慢 难以满足实时视觉任务描述子维度较高128维 存储和匹配开销较大对大视角变化支持有限 大倾角拍摄时匹配性能下降没有充分利用颜色、多光谱等信息 在特殊数据上表现受限自然在 SIFT 提出后的二十多年里大量研究工作开始围绕这些问题不断改进并提出变体和新算法。基于这些本篇内容围绕以下问题展开SIFT 的变体是否像其他领域一样将 SIFT 这样的起点算法完全取代特征检测算法是否有了新的突破DL 盛行的当下SIFT 现代价值是怎么样的为了较清晰地回答这些问题可以大致将后续发展分为以下四类让 SIFT 更快。让 SIFT 的描述能力更强、匹配更加准确。让 SIFT 能适应更多特殊应用场景。深度学习方法。前三类工作虽然采用的方法各不相同但都没有脱离 SIFT 的整体框架。真正改变这一领域发展方向的还是最后的深度学习时代以数据驱动的逻辑重新设计特征检测与匹配算法。6de0a39a-18cf-446c-9491-6ec5449054e0.png第一条路线让 SIFT 更快#那一大串复杂的算法管道让 SIFT 精度有了保障在很长一段时间里它一直都是局部特征匹配精度的标杆。但相应地SIFT 的计算速度也限制了它的广泛应用它几乎每一步都需要大量计算这些操作共同带来了较大的计算开销。对于图像拼接而言这样的速度通常还能接受因为拼接更关注最终精度。但对于另外一些视觉任务例如视频实时处理、机器人定位、自动驾驶等领域算法往往需要达到几十帧甚至上百帧每秒FPS的处理速度。此时SIFT 的计算量就成为最大的瓶颈。改进想法自然出现能否保留 SIFT 的整体思想尝试把那些计算最耗时的部分换成更简单、更快速的实现SURF就是围绕这个问题诞生的。2.1 SURF用近似计算换取速度#2006 年论文 SURF: Speeded Up Robust Features 提出了 SURF它的目标十分直接在尽量保持 SIFT 匹配性能的前提下大幅提高计算速度。SURF 几乎保留了 SIFT 的整个处理流程但在每一个计算量最大的地方都寻找了一种更加高效的替代方案。先摆个表格整体来看二者的对应关系如下SIFT SURFDoG 检测器 Hessian 行列式高斯卷积 Box Filter箱式滤波梯度计算 Haar 小波响应128维描述子 64维描述子下面来简要展开一下2.2 Box Filter 和积分图#SIFT 为了计算 LoG需要不断进行高斯卷积高斯卷积虽然精确但卷积核越大计算量也越大。于是 SURF 采用了一种更简单的近似方法Box Filter箱式滤波器。8341caac-b7c3-4beb-b272-f8f27fe482f8.png如图所示Box Filter 其实就是用了更简单的权重取代高斯核。这样SURF 不再需要像 SIFT 那样不断建立高斯金字塔而是直接通过改变滤波器尺寸来模拟不同尺度。而与其搭配使用的是一种数据结构积分图Integral Image它本质上是一张累加表8b71ab02-ccac-41bd-aea6-7d3e0e50683e.png同样如图积分图和 Box Filter 的配合起到了如下作用任意矩形区域内的像素和都可以通过四次加减运算直接得到。配合 Box Filter 的简化权重可以让卷积不再逐个加权求和而是通过常数级的计算构建金字塔。这是整个算法能够加速的基础。2.2 进一步简化描述子#除去对检测器的加速外SURF 对描述子的计算也进行了简化。SIFT 在每个子区域统计多个方向的梯度直方图最终得到 128 维描述子。而 SURF 则采用 Haar 小波响应其实就是差分只统计四个统计量cda1ecd8-b4c1-416d-bf4e-014100c4d4fd.png这样最终描述子维度变为了 64 维后续匹配速度进一步提高。经过这一系列近似替换SURF 在保持较高匹配性能的同时大幅降低了计算复杂度在典型情况下比 SIFT 约快 25 倍 。但实际加速比例会受到图像规模、特征点数量以及具体实现方式等因素影响因此不同实验中的速度提升并不存在统一数值。第二条路线让描述子更精确#SURF 解决了 SIFT 的速度问题。但研究者们很快便发现了新的优化空间SIFT 使用 128 维梯度直方图获取的描述子信息丰富区分能力强但带来了两个问题维度较高 需要更大的存储开销和更慢的匹配速度。各维度的重要性并不完全相同 有些方向上的梯度特别强而另一些方向虽然较弱却同样包含着有价值的信息。于是便有了另一种优化思路能不能保持 SIFT 检测器不变只改描述子本身的获取逻辑来提升精度随后几年大量工作开始围绕描述子展开。3.1 RootSIFT改动最小收益最大#2012 年论文 Three things everyone should know to improve object retrieval 提出的 RootSIFT 是一个改动极小的变体它唯一修改的仅仅是最后一步描述子的归一化方式。SIFT 在得到描述子以后会进行 L2 归一化这样可以减弱整体亮度变化带来的影响。但研究者发现仅使用 L2 归一化仍然存在一个问题假设某个方向上的梯度特别强欧氏距离会更多关注最大的那个数值80 与 79 的差异往往比 3 与 1 的差异更加影响最终距离。但对于局部特征来说那些较小的梯度方向同样可能包含着重要的信息。于是RootSIFT 把最后一步改成了少见的 L1 归一化后再开平方整个改动就只有这一行公式但它在多个公开数据集上都获得了约 10%20% 的匹配精度提升。其逻辑可以这么理解RootSIFT 会削弱那些特别大的梯度响应让原本较弱的方向拥有更多的话语权这样描述子的各个维度能够更加均衡地参与匹配。最终RootSIFT 几乎不增加任何额外计算却能够显著提升匹配效果因此被认为是性价比最高的 SIFT 改进之一在许多工程实践中已经成为默认配置。3.2 PCA-SIFT更精简的描述子#除了提高精度还有另一部分研究者提出了一个问题128 维描述子中是否存在冗余还是图像数据的偏置相邻方向之间、相邻网格之间本身就存在较强相关性。因此128 维之间并不是完全独立的能不能把这些重复的信息压缩掉04 年论文 PCA-SIFT: A More Distinctive Representation for Local Image Descriptors 提出了 PCA-SIFT显然其关键技术是我们之前展开过的 PCA。但其改进了 PCA 的使用思路做法是这样的对大量训练图像提取 SIFT 描述子组成矩阵进行 PCA取最终结果中固定维度的主成分组成投影矩阵对之后新的描述子直接使用该投影矩阵降维。0ecd47a5-833a-412a-a7ce-834e311355c3.png这么做是因为如果两张图各自 PCA那么同一个点投影以后就在不同坐标系描述子无法比较所以必须都用同一个 PCA。直观来看这样不仅减少了存储空间也提高了匹配速度。但由于 PCA 投影矩阵需要提前训练让其泛用性较低自然图像训练得到的投影矩阵未必适用于遥感图像可见光训练得到的模型也未必适用于高光谱图像。因此PCA-SIFT 虽然理论出色但实际应用远没有 RootSIFT 广泛。3.3 GLOH重新设计描述子#此外还有一部分工作则没有选择修改归一化方式也没有选择降维而是重新设计描述子的空间结构。其中比较具有代表性的是 05 年的论文 **A Performance Evaluation of Local Descriptors 提出的 GLOHGradient Location and Orientation Histogram其采用 极坐标划分同心圆后统计方向 的方式生成描述子109342a5-a8a0-406b-b77b-805153d27013.png这种结构更加符合图像中局部区域的几何分布因此理论上能够表达更多空间信息。但这也意味着更复杂的计算而且最终 GLOH 仍然需要利用 PCA 再次降到 128 维。虽然实验结果表明它的描述能力略优于 SIFT但是提升并不算明显而实现复杂度却增加了不少。因此这类方法更多还是停留在学术研究中。第三条路线让 SIFT 适应更多场景#经过前面的改进SIFT 的速度越来越快描述子也越来越成熟。但在不断实验中研究者们发现 SIFT 还存在一点局限它的不变性其实是有限的当两张图像之间存在较大的拍摄角度变化比如无人机俯视拍摄或者手持相机斜拍建筑时SIFT 的匹配性能会明显下降。因为这些情况下同一个物体在图像中的形状已经发生了明显拉伸。这种变化已经不再是简单的旋转或缩放而属于仿射变换Affine Transformation 的范畴了一种介于刚体变换只允许平移和旋转保持长度与角度和更一般的投影变换之间的几何模型能够很好地描述许多实际拍摄场景中的局部形变是计算机视觉中应用最广泛的变换模型之一。7ee88804-eda0-4771-8a9a-17e56c02f33d.png