遥感与自动驾驶分割——大图、小目标、实时性,三座大山

📅 2026/7/27 12:29:20
遥感与自动驾驶分割——大图、小目标、实时性,三座大山
前面六篇把通用分割、医学分割都聊了一遍今天咱们聊聊两个大场景——遥感分割和自动驾驶分割。这两个场景放在一起聊是因为它们面临的工程挑战惊人地相似图像大、目标小、实时性要求高、模型要跑在边缘设备上。但它们的难法又不太一样——一个是图大到你显存装不下一个是慢了就会出人命。遥感分割——你见过10000x10000的图像吗先聊遥感。卫星拍下来的一景影像分辨率通常是几千到几万像素。你拿一个标准的224x224的分类网络来处理连一张图的万分之一都覆盖不了。遥感分割的第一大问题是大图推理。你不能把整张图塞进模型显存会爆。必须用滑窗推理Sliding Window——把大图切成小块比如512x512每块分别送进模型然后把所有块的结果拼接起来。滑窗推理说起来简单做起来全是细节窗口尺寸怎么选太小了每个窗口里的上下文不够分割精度下降太大了显存放不下。512x512是个常见的折中尺寸。步长怎么设步长等于窗口尺寸不重叠速度快但窗口边界处的分割结果不连续步长小于窗口尺寸有重叠精度提高了但计算量成倍增加。边缘效应怎么处理窗口边缘的像素在分割时缺少外部的上下文信息容易分错。通常的解决方法是忽略窗口边缘一定宽度的像素比如忽略边缘8个像素只取中间区域的预测结果。这样保证了连续性但降低了有效覆盖面积。怎么把小块拼接起来如果使用了重叠区域重叠区域的像素有多个预测结果取平均还是取投票常见做法是中心权重加权——离窗口中心越近的像素权重越大因为中心区域受边缘效应影响最小。遥感分割还有一个麻烦事儿——旋转不变性。图像上的房子、道路、农田是各种朝向的如果你的模型只做过水平翻转的数据增强遇到旋转45度的建筑群可能就认不出来了。所以遥感分割里旋转增强是标配甚至有些工作专门设计了旋转等变卷积来让模型对旋转不敏感。自动驾驶分割——慢了真会出人命再聊聊自动驾驶。这可能是分割领域容错率最低的应用——你分割错了路面上的一块区域车可能就压到路肩或者撞上障碍物。自动驾驶分割的核心挑战是实时性与精度的平衡。一辆车在城市道路上行驶摄像头以30-60帧每秒的速度采集图像。从图像拍到到分割结果出来留给你的时间窗口只有30-50毫秒——超过了这个时间控制模块就来不及做决策了。在30毫秒的约束下你能做的计算量极其有限。这就是为什么自动驾驶里轻量级模型比如ENet、ERFNet、SwiftNet比那些在Cityscapes上刷榜的重型模型更受欢迎。你精度再高跑不到实时就是没用。自动驾驶分割的另一个难点是小目标检测。道路远处的行人、交通标志、自行车在图像里可能只有十几个像素大。这些小目标对行车安全至关重要但分割模型在低分辨率特征图上很容易漏掉它们。解决小目标的方法跟其他领域类似——多尺度特征融合、高分辨率输入、专门的小目标数据增强。但每一个方案都要在实时性的约束下做权衡高分辨率输入意味着更大的计算量多尺度融合意味着更多的网络分支。域适应——在自动驾驶里逃不掉的宿命自动驾驶分割有一个极为头疼的问题训练数据公开数据集和部署环境真实道路之间的域差异。你在Cityscapes上训好的模型直接拿到德国的真实道路上跑表现尚可。但拿到美国、中国、印度去用光照不同、道路风格不同、车辆类型不同、路标设计不同精度能掉10-15个百分点。解决这个问题的方向是域适应Domain Adaptation。无监督域适应的思路是源域有标签的Cityscapes训练一个模型目标域无标签的真实道路数据上只做推理通过对抗训练或者自训练的方式让模型适应目标域的分布。这方法在学术界发了不少论文但工业界用得不多——因为训练太不稳定而且无法保证在所有场景下都能适应。工业界更务实的做法是数据采集人工标注——你要在哪个国家/城市部署就在当地采集大量真实道路数据然后做人工标注用这些数据来训练或微调模型。虽然贵标注一张自动驾驶的街景图要几百块钱但这是唯一能保证精度的方式。轻量化架构——在边缘设备上活下去遥感和自动驾驶有一个共同的工程约束——模型要跑在边缘设备上。无人机上不可能装一块A100自动驾驶的车载计算平台比如NVIDIA Drive Orin虽然算力比普通嵌入式设备强但相比服务器还是差了十倍。你必须在精度和速度之间做出取舍。轻量化分割模型的设计思路通常是用轻量级backboneMobileNet、EfficientNet-Lite、ShuffleNet减少解码器的层数和通道数用深度可分离卷积替代普通卷积在关键层做剪枝和量化用神经架构搜索NAS自动寻找精度-速度的帕累托最优结构我见过最极端的案例是在无人机上进行森林火灾检测。那台无人机的边缘盒子只有1.5TOPS的算力我们最后把模型压缩到了500KB的参数量推理一帧要80毫秒——虽然精度比原始的DeepLabv3掉了8个点但在那种极端算力约束下已经是最优解了。一个共同的痛——标注成本遥感和自动驾驶还有一个共同的、说出来想哭的问题——标注太贵了。遥感图像分割要标建筑物、道路、水体、植被、农田……一张卫星图覆盖几平方公里标注员要像绣花一样把每栋房子、每条路的边界描出来。标一张图的工作量相当于标几百张自然图像。自动驾驶更不用说了——Cityscapes的一张精细标注图标注员要花几个小时来描轮廓。标一整套Cityscapes的数据集几千张图成本在上百万。这就是为什么弱监督分割、无监督域适应、自监督预训练在遥感和自动驾驶领域特别受关注——大家都在想方设法降低对像素级标注的依赖。我的感受这个领域正在从炫技走向务实五年前大家还在拼命刷Cityscapes和PASCAL VOC的精度榜单谁的mIoU高谁就是老大。但最近几年风向明显变了——大家更关心在给定算力约束下的精度、在真实场景下的泛化能力、在有限标注下的学习效率。遥感和自动驾驶分割已经从实验室竞技进入了工程化落地的阶段。在这个阶段一个能在Jetson上稳定跑30FPS、精度75%的模型比一个在A100上跑2FPS、精度85%的模型更有价值。这个道理做工程的人懂做学术的人未必懂。