【论文学习】Medical Image Analysis 2024 || 医学图像分割中失败检测方法的比较基准研究:揭示置信度聚合的作用

📅 2026/8/9 6:16:36
【论文学习】Medical Image Analysis 2024 || 医学图像分割中失败检测方法的比较基准研究:揭示置信度聚合的作用
Failure DetectionComparative Benchmarking of Failure Detection Methods in Medical Image Segmentation: Unveiling the Role of Confidence Aggregation医学图像分割中失败检测方法的比较基准研究揭示置信度聚合的作用这篇论文研究的是如何判断医学分割模型什么时候会失败并系统比较不同判断方法其中重点分析“如何把像素级置信度信息汇总成一个整体可靠性评分”的作用方法思想Entropy看模型是否犹豫MC Dropout看多次预测是否一致Deep Ensemble多个模型是否一致Quality Regression直接预测mask质量OOD detection判断是否偏离训练数据论文指出过去不同工作使用不同任务定义和评价指标导致方法难以公平比较因此他们提出统一benchmark医学分割模型通常输出每个像素的置信度。但是问题临床需要知道“整个病例可靠吗”所以需要Confidence Aggregation置信度聚合也就是把几万个像素的confidence变成一个整体分数。该论文研究医学图像分割中的可靠性问题提出系统性的Failure Detection Benchmark通过比较不同置信度估计与聚合方法分析模型能否提前识别潜在失败预测并利用Risk-Coverage评价其实际安全价值Medical Image Analysis 2024这篇论文不是做 intervention纠正而是做failure detection失败检测也就是说它解决的是“模型什么时候会失败”这篇论文首先指出虽然深度学习医学分割模型在很多数据集表现很好但是在真实临床环境中模型仍然会产生错误分割不能盲目信任预测结果。如果进入后续任务肿瘤体积计算放疗规划临床分析可能造成问题。所以他们提出需要一个额外模块Failure Detection核心思想传统医学分割Image ↓ Segmentation ↓ Output mask问题模型不知道“这个mask可靠吗”所以增加Image ↓ Segmentation ↓ Confidence score ↓ Accept / Reject也就是给每一个预测一个可信度。论文定义一个 confidence scoring function输入imagepredictionsegmentation model输出confidence score κ高confidence接受预测。低confidence拒绝或者人工检查。论文核心问题How to detect segmentation failures?他们比较了很多failure detection方法。主要分三类方法1Uncertainty estimation不确定性估计例如Entropy模型预测概率如果foreground 0.5 background 0.5说明模型不确定。MC Dropout测试阶段打开dropout多次预测Prediction 1 ​ Prediction 2 ​ Prediction 3 ...如果差异大说明模型不稳定。方法2Quality Regression质量预测直接预测这个mask Dice是多少方法3OOD Detection例如Mahalanobis distance。判断测试样本是否偏离训练分布。但是论文指出OOD detection ≠ Failure detection因为一个样本可能OOD但是分割正确。或者ID但是分割失败。最大的贡献Risk-Coverage分析他们认为过去评价failure detection有问题很多只看AUROCcorrelation但是没有考虑实际系统性能。所以提出Risk-Coverage Curve思想模型有权选择接受哪些预测。拒绝哪些预测。例如confidence高接受。confidence低拒绝。形成Coverage ↑ ​ Risk ↓论文认为risk-coverage analysis能够同时考虑confidence rankingsegmentation performance并提出AURC作为综合指标。摘要语义分割是医学图像分析研究中的重要组成部分。近年来随着深度学习算法的发展医学图像分割模型已经能够在不同数据集上实现较好的开箱即用out-of-the-box应用效果。然而尽管取得了这些进展分割失败问题仍然是实际临床应用中的重要挑战因此需要可靠的失败检测机制来识别潜在错误。本文提出了一个全面的基准评测框架comprehensive benchmarking framework用于系统评估医学图像分割中的失败检测方法。通过分析不同方法本文揭示了当前失败检测评价指标的优势与局限性并提出将风险-覆盖率分析risk-coverage analysis作为一种更加全面的评价方式。作者利用由五个公开三维医学图像数据集组成的综合数据集合在真实的测试阶段分布偏移test-time distribution shifts条件下评估了多种失败检测策略的有效性。实验结果表明像素级置信度聚合pixel confidence aggregation在失败检测中具有重要作用。其中基于模型集成预测之间的两两Dice相似度pairwise Dice score方法表现优异证明其是一种简单且具有鲁棒性的医学图像分割失败检测基准方法。为了推动后续研究本文进一步公开了该失败检测基准评测框架供研究社区使用。图一图1本文研究问题与贡献的概述。基于图像级故障检测任务的正式定义我们界定了评估协议所需满足的要求对现有故障检测指标进行了比较并确定风险覆盖分析是一种合适的评估协议随后我们提出了一个用于医学图像分割中故障检测的基准测试框架该框架包含了一个多样化的三维医学图像数据集集合同时我们对比了广泛的相关方法包括针对图像级置信度和聚合像素置信度的研究方向——这些方面此前大多仅在独立研究层面展开。这张图总结了这篇论文什么是医学分割中的 Failure Detection失败检测如何评价 Failure Detection 方法如何建立统一 Benchmark 比较不同方法如何让失败检测任务定义符合实际临床需求医学分割模型输出结果以后实际应该做什么模型输出以后我们不知道这个结果可靠吗所以加入Confidence scoring置信度评分除了输出mask还输出一个可信度分数。然后和阈值比较如果置信度 阈值那么accept接受这个预测。如果置信度 ≤ 阈值那么reject拒绝这个预测。什么评价方法能够真正反映失败检测任务定义预测风险Dice越高说明分割越好风险越低Confidence和Risk关系理想情况右侧高confidence应该对应低risk。但是实际有些confidence高risk也高。说明模型很自信但是错了。Risk-Coverage Analysis作者提出不要只看confidence是否准确。而要看如果我们选择接受多少样本剩余风险是多少Coverage50%表示保留50%的预测那么这些预测平均风险是多少形成Risk-Coverage Curve。曲线越低越好AURC就是Risk-Coverage曲线面积。越低说明模型越会挑选可靠预测哪一种方法能够在不同医学数据集上泛化作者提出建立统一Benchmark。他们收集多个医学3D数据集并测试不同confidence方法像素级置信度 聚合图像级置信度问题 ​ 医学分割会失败 ↓ 需要知道什么时候不能相信模型 ​ ↓ ​ 提出Failure Detection ​ ↓ ​ Segmentation Confidence ​ ↓ ​ Accept / Reject ​ ​ ↓ ​ 如何评价 ​ Risk-Coverage AURC ​ ​ ↓ ​ 建立Benchmark ​ 比较 ​ Pixel confidence aggregation ​ vs ​ Image confidence ​ 在多个医学数据集上的表现表一表1分割失败检测的度量指标比较。其中 AURC 是唯一能反映分割性能和置信度排序的度量指标我们认为这对于全面评估故障检测系统至关重要。关于各列所涉及的要求R1–R3的详细讨论见第2节。f- AUROC 使用二元故障标签。MAE平均绝对误差PC皮尔逊相关系数SC斯皮尔曼相关系数。医学图像分割失败检测应该用什么评价指标为什么作者最终选择 AURCArea Under Risk-Coverage Curve只有 AURC 同时考虑模型置信度排序能力分割结果本身的质量不同风险定义。因此最适合作为 failure detection 的评价指标表二表2本研究中所使用的数据集汇总表。“#Testing”列中测试集各子集的案例编号以逗号分隔排列顺序始于分布内测试划分随后依次为偏移后的“域”。类别数量中已包含一个背景类别的计数。作者如何构建一个能够真实测试医学分割模型失败检测能力的数据环境不能只在一个数据集、一个医院、一个分布内测试而应该加入真实世界中的数据分布变化distribution shift图二图2单个U-Net模型在测试集上的分割性能。方框内显示中位数和 IQR 值而须线分别延伸至第5和第95百分位数。每个数据集均包含来自与训练集相同分布的样本内部分布ID以及来自不同数据分布的样本数据集偏移这些样本具有相同的待分割结构。通常模型在内部分布样本上的性能优于在分布偏移样本上的性能但对于肾脏肿瘤缺乏数据集偏移和COVID-19数据集仍存在若干内部分布下的失败案例。Failure Detection论文中证明“为什么需要失败检测Failure Detection”的实验结果医学分割模型在面对真实世界的数据变化时会不会失败失败是否只发生在分布偏移domain shift情况下