黑光全彩为什么必须在Raw域降噪?——DeepISP的联合优化遗产

📅 2026/8/15 13:45:56
黑光全彩为什么必须在Raw域降噪?——DeepISP的联合优化遗产
一、制造认知缺口低光下传统ISP的第一步就在制造问题安防监控的黑光全彩场景面临一个被反复低估的技术挑战不是噪声太多而是噪声被Demosaic去马赛克放大了之后再去降噪已经晚了。理解这个问题需要回到CMOS传感器的物理结构。Bayer阵列的传感器在每个像素位置只安装一种颜色的滤光片——R红、G绿或B蓝。这意味着传感器的原始输出不是不完整的三通道彩色图像而是一个单通道、马赛克状的灰度阵列。将这份数据转换为人类和机器可以理解的RGB彩色图像必须经过Demosaic——根据周围像素的信息插值出每个像素缺失的另外两个通道。问题在于Demosaic是一个基于空间相关性假设的插值操作。 它假设相邻像素的颜色值是平滑变化的因此可以用邻域像素的已知颜色值来推测缺失值。在信噪比充足时这个假设基本成立。但在黑光场景中——信噪比低于10dB甚至更低——噪声已经篡改了每个像素的原始读数。此时Demosaic不仅会把错误的像素值插值到邻域更致命的是插值过程本身会创造出全新的、在原始数据中根本不存在的噪声模式一个噪点像素被Demosaic后变成了三个通道上各有不同噪声偏差的彩色噪点。这些二次污染的噪声与原始噪声在统计分布上完全不同后续的降噪模块面对的是一个比原始问题更复杂的问题。这正是传统ISP先Demosaic、再降噪路线的结构性缺陷。另一种选择——先降噪、再Demosaic——同样困难在Bayer域降噪时每个像素只有一个通道降噪算法没有其他通道的信息来交叉验证异常值到底是噪声还是真实边缘。二、核心洞见联合优化——让一个网络同时理解噪声和马赛克2018至2019年以色列理工学院Technion的Eli Schwartz、Raja Giryes和Alex M. Bronstein在IEEE TIP上发表了DeepISP首次系统性地回答了这个问题去噪和去马赛克不应该分步做应该让一个神经网络联合学习两项任务。联合优化的PSNR显著高于任何分步串联组合。这一洞见背后是一个深刻的认知迁移。传统ISP的分步架构源于人类工程师的模块化思维——把一个大问题拆成小问题逐个解决。但拆这个动作本身就切断了任务之间的信息交互。去噪需要理解马赛克模式知道哪些波动是Bayer采样导致的固有不均匀去马赛克需要理解噪声分布知道哪些梯度是噪声引起的虚假梯度这两个任务在信息层面是共生的将它们分配给两个互不通信的模块本质上是在强迫每个模块在不完整信息下做决策。DeepISP的架构体现了联合优化思想的完整落地。它不是简单地把两个任务的损失函数加在一起而是在网络结构层面实现了信息共享。第一阶段Low-level阶段——局部修复与隐式联合。输入是经过Bilinear插值预处理简单Demosaic的低光照Bayer Raw图像。这一阶段由20个残差块堆叠而成每个残差块输出64个特征通道。其中3个通道映射为RGB残差图像并与当前块的输入RGB估计相加剩余61个通道作为特征记忆向前传递。这种每层都显式输出RGB估计并允许后续层修正的设计让网络可以在20个深度层次上逐步精修联合去噪去马赛克的结果——浅层处理粗粒度的噪声和插值深层处理细粒度的伪影。更重要的是所有低层共享同一个特征表示去噪子网络和去马赛克子网络不需要猜测对方的状态——它们就是在同一段特征代码上共同决策的。消融实验提供了令人信服的证据去除残差连接skip connections的版本在5000个epoch后损失仍然比完整版本高两个数量级——联合优化需要深网络而深网络的稳定训练依赖残差连接。第二阶段High-level阶段——全局参数化校正。第一阶段输出的图像已经完成了去噪和去马赛克联合处理但低照度下的全局属性——色温偏移、整体偏暗——仍需修正。第二阶段的处理方式极具工程智慧将第一阶段传过来的61个特征通道通过逐层下采样stride 2和全局平均池化压缩为一个全局特征向量再通过全连接层输出一个3×10的变换矩阵W。这个矩阵定义了一个像素级的二次色彩变换函数输出_RGB W · triu([R G B 1]^T ⊗ [R G B 1])其中triu取外积的上三角部分包含R、G、B的一次项、二次项和交互项。这种image-to-parameter的思路意味着第二阶段只有几千个参数却可以实现全局白平衡、曝光校正和色彩映射比逐像素深度学习高效得多。损失函数同样体现了联合的思想在Lab色彩空间上同时施加L1损失所有通道保证全局色彩准确和MS-SSIM损失仅L通道保证局部纹理保真。MS-SSIM对亮度的微小偏移不敏感而L1对色彩偏差很敏感——两个互补的损失函数联合优化远比单一损失的泛化效果好。三、验证洞见数据驱动的联合优化优势DeepISP在MSR demosaicing benchmark上进行了联合去噪去马赛克任务的定量评估Panasonic测试集线性空间PSNR较此前SOTA方法SEM提升0.38dB较另一深度学习方法提升0.71dBPanasonic测试集sRGB空间较SEM提升0.72dB较深度学习方法提升1.05dBCanon测试集线性空间较SEM提升0.61dBCanon测试集sRGB空间较SEM提升1.28dB。Cross-sensor泛化在Panasonic数据上训练、在Canon数据上测试取得了正向结果证明联合优化的优势不是数据特异的——网络学到的是噪声模式与马赛克模式的交互规律而非特定传感器的统计特征。在S7 ISP数据集上的全Pipeline评估中DeepISP输出的低光照图像在人类主观评分MOS上达到4.02满分5分超过三星S7原生ISP的3.74仅比正常光照下的高质量参考图像MOS 4.05低0.7%。这意味着DeepISP的输出在主观上已经接近人眼在充足光照下看到的画面——而这完全是在没有补光灯辅助的条件下实现的。DeepIQA基于深度学习的图像质量评估模型的评分同样确认了这一结果DeepISP 3.92 vs 三星ISP 3.72。最关键的发现是消融实验中的一个对比切断Low-level阶段与High-level阶段之间的特征连接让两个阶段独立运行、各自分配相同参数预算——图像质量显著下降。这直接证明了共享特征即联合优化本身就在提升性能而不是因为参数更多或网络更深。四、推开一扇窗Pico-G1在Bayer Raw域的联合优化实践DeepISP给工程界留下的最大遗产不是用端到端网络替代整个ISP流水线这个激进主张而是一个更务实的方法论在任务交互最紧密的节点做联合优化而不是在任务独立的地方强行合并。对于黑光全彩场景任务交互最紧密的节点首先是Bayer Raw域的降噪。这正是ShiMeta Pico-G1的AI_NR模块的战略定位。Pico-G1基于GK7206芯片NPU总算力1.0T。AI_NR消耗0.5T在Bayer Raw域做深度学习降噪支持4M15fps实时处理。这个在Raw域降噪的选择直接继承了DeepISP的核心发现——联合优化优于分步优化。Pico-G1采用大模型蒸馏小模型微调云端通用降噪大模型提供先验端侧0.5T轻量模型实时推理避免端侧从头训练的算力天花板。最终效果无需红外补光灯暗光全彩输出。AOV低功耗模式下整机42mW2Mp/1fps电池供电的黑光全彩监控从理论走向现实。DeepISP 2018年的结论在Pico-G1上得到了工程验证不需要用AI替代整条ISP只需要在信息损失最快的那个节点让AI深度介入一次。-----本文是对原论文的解读与发散原作者和所属机构未参与本文撰写亦无任何利益关联。原论文DeepISP: Towards Learning an End-to-End Image Processing PipelineEli Schwartz, Raja Giryes, Alex M. BronsteinIEEE Transactions on Image Processing, 2019. 论文地址https://arxiv.org/abs/1801.06724