SSMPD:半监督多光谱行人检测

📅 2026/8/8 9:28:17
SSMPD:半监督多光谱行人检测
SSMPD半监督多光谱行人检测01 论文信息论文题目SSMPD: Semi-Supervised Learning for Multispectral Pedestrian Detection论文作者Seungho Shin, Chan Lee, Gyeong-Moon Park, Jung Uk Kim发表单位韩国庆熙大学Kyung Hee University、韩国高丽大学Korea University发表会议/期刊IEEE Transactions on Multimedia (TMM), Vol. 28, 202602 论文主要贡献把“半监督学习”成功用在“多光谱行人检测”上的研究。它设计了一套专门针对多光谱数据的伪标签质量控制系统让我们只需要标注 10% 的图片就能训练出媲美 100% 全标注的检测器省下 90% 的标注。03 论文创新点行人外观感知PAA权重充当“智能质检员”通过对比伪标签和真实标签在特征层面的相似度自动判断伪标签质量。好的多学差的少学让训练过程极其稳定。统一模态感知同步学习UMAS让学生模型同时从“可见光”、“热红外”、“融合模态”三个分支学习。一个模态不给力另外两个立马补上利用多光谱的丰富信息抵消半监督的不确定性。基于相似度的对比损失SC Loss在特征层面拉近好伪标签与真实标签的距离推远坏伪标签与真实标签的距离进一步打磨伪标签纯度。04 方法与原理详解4.1 为什么要做这个研究这张图包含了三个子图是整篇论文的“灵魂动机”图 (a) —— 标注多光谱图片。图 (b) —— 标签越少性能崩得越快。图 © —— 半监督设定的直观展示。4.2 本文的方法比以前的强多少这张图是一张直方图柱状图对比图展示了在 KAIST 数据集上1%、5%、10% 标注比例下的漏检率MR。横轴分为 1%、5%、10% 三个组别。纵轴Miss Rate越低越好。柱状图构成每一组里都有好几个柱子分别代表 Supervised纯监督、STAC、Unbiased Teacher、Soft Teacher、ARSL、Sparse Semi-DETR 以及本文的 SSMPD。4.3 核心骨架SSMPD 整体网络架构这张图分为三个区域我们按箭头方向从上往下看左上方 —— 教师模型Teacher Model左下方 —— 学生模型Student Model与 UMAS 学习右侧 —— 相似度对比损失SC Loss4.4 多样性的数据选择在只有 1% 标注的情况下选哪 1% 的图片来标注决定了生死。这张示意图完美解释了作者提出的“K-means 聚类采样”策略。左侧 —— 杂乱无章的原始数据中间 —— K-means 聚类右侧 —— 分层均匀采样05 实验分析论文用大量实验证明 SSMPD 的有效性。除了看数据表格我们还必须看原文中的可视化图片Figure 5-9因为它们直观地展示了模型在“地狱难度”下的表现。5.1 为什么纯靠视觉容易犯错作者指出本文的 SC Loss 在特征层面严格区分了这种伪标签特征与真实行人特征强行拉大距离。即使视觉上像特征空间里不像模型就不会被骗从而减少了误报。5.2 下雨天看不清怎么办这证明了算法在真实恶劣天气下的巨大应用潜力。5.3 黎明时分的“阴阳脸”场景图中展示了这种“一半亮一半暗”的图片对。仅靠可见光暗区行人看不见仅靠热红外亮区行人纹理模糊。本文结果绿色框Ground Truth和红色框Prediction高度重合。作者利用 UMAS 学习强制学生模型在可见光和热红外两个单分支上都要学得准。所以无论行人是在被阳光照射的亮区还是楼阴影下的暗区融合特征都能兼顾一个不漏。5.4 KAIST 数据集上的最终对决这是论文最重磅的定性对比图。图中展示了在 1%、5%、10% 标注下各种方法Baseline、Consistent Teacher、ARSL 等的框选效果。看那些漏掉的False Negative看错位的False Positive看本文的 SSMPD5.5 LLVIP 低光数据集在这种极端低光下可见光图像几乎全黑没有任何纹理。热红外图像虽然有人形但背景噪声很大。表现基线方法在这种图上基本束手无策常常出现“鬼影”或漏框。而 SSMPD 依然稳定输出检测框。这说明 SSMPD 在训练时通过 UMAS 策略让学生模型极度依赖热红外分支的特征。当可见光彻底罢工时热红外和融合分支依然提供强大的学习信号保证了极端黑暗下的实战能力。06 总结与讨论论文解决了什么根本问题它证明了在多光谱行人检测中我们不需要海量的人工标注。通过作者设计的“PAA 质量自查”、“UMAS 模态互补”和“SC 特征精炼”三大模块哪怕标注量只有 10%SSMPD 也能达到接近 100% 全监督学习的性能。这能在现实世界的自动驾驶、安防监控中节省数百万的标注经费。存在的局限训练时间变长了因为要同时跑教师模型和学生模型还要过三个模态分支训练一个批次比基线慢了大约 20%。依赖于初始教师质量如果初始给的 1% 标签质量特别差比如全是重复的高速路场景教师模型从一开始就是“瞎子”后续提升有限——但好在作者提出了 Figure 4 的数据选择策略来缓解这个问题。