医学论文解读:iSegFormer: Interactive Segmentation via Transformers with Application to 3D Knee MR Images

📅 2026/8/11 3:54:29
医学论文解读:iSegFormer: Interactive Segmentation via Transformers with Application to 3D Knee MR Images
会议MICCAI年份2022英文名字iSegFormer: Interactive Segmentation via Transformers with Application to 3D Knee MR Images中文译为iSegFormer: Interactive Segmentation via Transformers with Application to 3D Knee MR Images一、摘要医学图像分割通常需要大量体素级人工标注而 3D MRI 的逐层、逐像素标注尤其耗时因此交互式分割是一种降低医学图像标注成本的重要方法。然而以往医学图像交互式分割方法基本采用 CNN。作者认为 CNN 的局部感受野限制了其建模长距离依赖和全局语义信息的能力因此尝试将 Transformer 引入这一任务。但 Transformer 用于 3D 医学图像交互分割存在两个主要困难Transformer 计算和显存开销大3D 医学影像的人工标注数据非常有限。为此作者提出iSegFormer使用Swin Transformer作为编码器使用轻量级MLP Decoder使用用户点击作为交互信息通过预训练缓解医学标注不足的问题最后结合视频目标分割模型STCN将少量已分割 2D MRI 切片的结果传播至整个 3D MRI。在 OAI-ZIB 膝关节 MRI 数据集上iSegFormer 的 2D 交互分割性能优于 CNN 方法。当仅使用5 张已交互分割的切片进行 3D 传播时股骨软骨最终达到82.2% Dice。二、创新点1 首次将 Transformer 用于交互式医学图像分割以往交互式医学分割基本都是 CNN例如MIDeepSegMONAI LabelRITM 等。作者提出利用 Transformer 的自注意力机制建模较远距离像素之间的关系从而改善交互式分割。论文认为这是首个基于 Transformer 的交互式医学图像分割方法。2 提出轻量化交互式 Transformer——iSegFormer直接采用传统 Transformer 会面临很大的显存和计算开销。作者因此将Swin Transformer Encoder与Lightweight MLP Decoder结合起来。这样既利用了 Transformer 的长距离建模能力又避免使用复杂的 Transformer Decoder。整个结构可以简单理解为ImageUser Clicks→Swin Transformer→MLP Decoder→Segmentation从而兼顾分割性能推理速度GPU 显存占用。3 将“视频目标传播”思想迁移到 3D MRI 分割这是这篇论文比较有意思的一个设计。作者发现视频连续帧与 MRI 连续切片具有一定相似性。视频中一个物体从第 t 帧到第 t1 帧通常变化不大。同理MRI 的第 z 张切片和第 z1 张切片中的软骨结构也具有连续性。因此作者直接使用视频目标分割中的STCN 已标注MRI切片→STCN→其他MRI切片实现从少量 2D 分割结果生成完整 3D 分割。值得注意的是STCN 并没有在医学图像上重新训练。即使如此仍然取得了不错的结果。三、方法整套方法实际上可以分成两个大的模块2D交互式分割3D切片传播​所提出的iSegFormer是一种基于Transformer的交互式2D图像分割方法它将Swin Transformer与轻量级MLP解码器相结合如图1所示通过将其与分割传播模块即STCN[14]相结合可以很容易地将其扩展为3D交互式分割方法。这种3D交互式分割方法由一个iSegFormer和一个分割传播模块组成iSegFormor用于从用户交互中获得2D分割分割传播模块将分割的切片重新划分为未分割的切片从而得到3D分割。如果传播的分割结果不理想用户可以通过进一步的交互对其进行改进并在必要时开始新一轮的传播。3.1 iSegFormer 网络结构首先完成单张 MRI 切片的交互式分割。输入包括两部分MRI Image原始膝关节 MRI 切片和Click Encoding。MRI Image由于 MRI 通常只有一个灰度通道而预训练 Swin Transformer 使用 RGB 三通道输入因此作者简单地将Gray→RGB即将灰度图重复三次。Click Encoding用户在图像上点击一些位置告诉模型这个地方应该属于软骨这个地方不应该属于软骨。分别对应Positive ClickNegative Click点击信息编码为一个 H×W×2的特征图。因此整体相当于 MRI ImageClick Map共同输入模型。3.2 自动模拟用户点击训练阶段不可能真的让医生不停地点击因此作者通过 Ground Truth 自动生成模拟点击。具体来说如果模型存在漏分区域 GT1,Prediction0则在False Negative 区域中心生成一个 Positive Click。如果存在误分区域 GT0,Prediction1则在False Positive 区域中心生成一个 Negative Click。然后模型重新分割。于是形成 Prediction→Error→New Click→Prediction→...这样的迭代交互过程。训练时还会给点击位置加入随机扰动以增强模型对真实用户点击位置变化的鲁棒性。3.3 3D Segmentation Propagation完成部分切片交互式分割之后作者进一步实现完整的 3D MRI 分割。例如假设一个 MRI volume 有160 slices医生不需要逐张处理 160 张图像。只需要选择少量切片比如 5 slices使用 iSegFormer 进行交互式分割。然后 5张已分割切片→STCN→其余155张切片从而得到完整 3D 软骨 segmentation。如果传播后的某一张结果不好用户可以重新点击修正该切片然后再次进行传播。因此构成一个 交互→传播→检查→修正→再次传播 的闭环。四、实验4.1 数据集主要采用OAI-ZIB Knee MRI Dataset一共有507 3D MRIs每个 MRI 160 slices单张大小 384×384原始数据包含FemurTibiaFemoral cartilageTibial cartilage。但本文只研究股骨软骨 胫骨软骨分割。4.2 结果作者与 CNN 交互分割方法RITM比较。CNN BackboneUNetHRNet32。TransformerSwin-BSwin-L。结果中比较典型的是NoC85也就是说CNN 可能需要约14−15次点击才能达到 85% IoU。而 iSegFormer 大约 11−12次点击就可以达到相同水平。因此用户需要进行更少的人机交互。五、结论作者提出了基于 Transformer 的医学图像交互式分割模型iSegFormer​其主要由 Swin TransformerLightweight MLP Decoder组成。相比 CNN 交互式方法iSegFormer 在膝关节软骨 2D 交互分割上能够使用更少的点击获得更好的分割结果同时保持接近 CNN 的计算效率。此外作者进一步将 iSegFormer 与视频目标传播模型STCN结合iSegFormer→少量2D切片→STCN→完整3D分割只使用5 张已分割切片就能够在股骨软骨 3D 分割上获得 82.2% Dice​而且 STCN 完全没有针对医学影像进行微调。作者因此认为将视频中的时序传播思想迁移到 3D 医学图像切片传播是一个很有潜力的研究方向。