会议:MICCAI
年份:2022
英文名字:iSegFormer: Interactive Segmentation via Transformers with Application to 3D Knee MR Images
中文译为:iSegFormer: Interactive Segmentation via Transformers with Application to 3D Knee MR Images
一、摘要
医学图像分割通常需要大量体素级人工标注,而 3D MRI 的逐层、逐像素标注尤其耗时,因此交互式分割是一种降低医学图像标注成本的重要方法。
然而,以往医学图像交互式分割方法基本采用 CNN。作者认为 CNN 的局部感受野限制了其建模长距离依赖和全局语义信息的能力,因此尝试将 Transformer 引入这一任务。
但 Transformer 用于 3D 医学图像交互分割存在两个主要困难:
- Transformer 计算和显存开销大;
- 3D 医学影像的人工标注数据非常有限。
为此,作者提出iSegFormer:
- 使用Swin Transformer作为编码器;
- 使用轻量级MLP Decoder;
- 使用用户点击作为交互信息;
- 通过预训练缓解医学标注不足的问题;
- 最后结合视频目标分割模型STCN,将少量已分割 2D MRI 切片的结果传播至整个 3D MRI。
在 OAI-ZIB 膝关节 MRI 数据集上,iSegFormer 的 2D 交互分割性能优于 CNN 方法。当仅使用5 张已交互分割的切片进行 3D 传播时,股骨软骨最终达到82.2% Dice。
二、创新点
1 首次将 Transformer 用于交互式医学图像分割
以往交互式医学分割基本都是 CNN,例如:
- MIDeepSeg;
- MONAI Label;
- RITM 等。
作者提出:
利用 Transformer 的自注意力机制建模较远距离像素之间的关系,从而改善交互式分割。
论文认为这是首个基于 Transformer 的交互式医学图像分割方法。
2 提出轻量化交互式 Transformer——iSegFormer
直接采用传统 Transformer 会面临很大的显存和计算开销。
作者因此将:Swin Transformer Encoder与Lightweight MLP Decoder结合起来。
这样既利用了 Transformer 的长距离建模能力,又避免使用复杂的 Transformer Decoder。
整个结构可以简单理解为:
Image+User Clicks→Swin Transformer→MLP Decoder→Segmentation
从而兼顾:
- 分割性能;
- 推理速度;
- GPU 显存占用。
3 将“视频目标传播”思想迁移到 3D MRI 分割
这是这篇论文比较有意思的一个设计。
作者发现:
视频连续帧与 MRI 连续切片具有一定相似性。
视频中,一个物体从第 t 帧到第 t+1 帧通常变化不大。
同理:MRI 的第 z 张切片和第 z+1 张切片中的软骨结构也具有连续性。
因此作者直接使用视频目标分割中的STCN: 已标注MRI切片→STCN→其他MRI切片,实现从少量 2D 分割结果生成完整 3D 分割。
值得注意的是:
STCN 并没有在医学图像上重新训练。
即使如此,仍然取得了不错的结果。
三、方法
整套方法实际上可以分成两个大的模块:2D交互式分割+3D切片传播
所提出的iSegFormer是一种基于Transformer的交互式2D图像分割方法,它将Swin Transformer与轻量级MLP解码器相结合如图1所示,通过将其与分割传播模块(即STCN[14])相结合,可以很容易地将其扩展为3D交互式分割方法。
这种3D交互式分割方法由一个iSegFormer和一个分割传播模块组成,iSegFormor用于从用户交互中获得2D分割,分割传播模块将分割的切片重新划分为未分割的切片,从而得到3D分割。如果传播的分割结果不理想,用户可以通过进一步的交互对其进行改进,并在必要时开始新一轮的传播。
3.1 iSegFormer 网络结构
首先完成单张 MRI 切片的交互式分割。
输入包括两部分:MRI Image原始膝关节 MRI 切片和Click Encoding。
MRI Image:由于 MRI 通常只有一个灰度通道,而预训练 Swin Transformer 使用 RGB 三通道输入,因此作者简单地将:Gray→RGB,即将灰度图重复三次。
Click Encoding:用户在图像上点击一些位置,告诉模型:
- 这个地方应该属于软骨;
- 这个地方不应该属于软骨。
分别对应:
- Positive Click
- Negative Click
点击信息编码为一个: H×W×2的特征图。
因此整体相当于: MRI Image+Click Map共同输入模型。
3.2 自动模拟用户点击
训练阶段不可能真的让医生不停地点击,因此作者通过 Ground Truth 自动生成模拟点击。
具体来说:
- 如果模型存在漏分区域: GT=1,Prediction=0,则在False Negative 区域中心生成一个 Positive Click。
- 如果存在误分区域: GT=0,Prediction=1,则在False Positive 区域中心生成一个 Negative Click。
然后模型重新分割。
于是形成: Prediction→Error→New Click→Prediction→...这样的迭代交互过程。
训练时还会给点击位置加入随机扰动,以增强模型对真实用户点击位置变化的鲁棒性。
3.3 3D Segmentation Propagation
完成部分切片交互式分割之后,作者进一步实现完整的 3D MRI 分割。
例如,假设一个 MRI volume 有:160 slices医生不需要逐张处理 160 张图像。
只需要选择少量切片,比如: 5 slices使用 iSegFormer 进行交互式分割。
然后: 5张已分割切片→STCN→其余155张切片,从而得到完整 3D 软骨 segmentation。
如果传播后的某一张结果不好:
用户可以重新点击修正该切片,然后再次进行传播。
因此构成一个: 交互→传播→检查→修正→再次传播 的闭环。
四、实验
4.1 数据集
主要采用:
OAI-ZIB Knee MRI Dataset
一共有:507 3D MRIs
每个 MRI: 160 slices
单张大小: 384×384
原始数据包含:
- Femur;
- Tibia;
- Femoral cartilage;
- Tibial cartilage。
但本文只研究:
股骨软骨 + 胫骨软骨分割。
4.2 结果
作者与 CNN 交互分割方法RITM比较。
CNN Backbone:
- UNet;
- HRNet32。
Transformer:
- Swin-B;
- Swin-L。
结果中比较典型的是NoC@85:
也就是说:
CNN 可能需要约:14−15次点击,才能达到 85% IoU。
而 iSegFormer 大约: 11−12次点击就可以达到相同水平。
因此用户需要进行更少的人机交互。
五、结论
作者提出了基于 Transformer 的医学图像交互式分割模型:
iSegFormer其主要由: Swin Transformer+Lightweight MLP Decoder组成。
相比 CNN 交互式方法,iSegFormer 在膝关节软骨 2D 交互分割上能够:
- 使用更少的点击;
- 获得更好的分割结果;
- 同时保持接近 CNN 的计算效率。
此外,作者进一步将 iSegFormer 与视频目标传播模型STCN结合:
iSegFormer→少量2D切片→STCN→完整3D分割
只使用5 张已分割切片,就能够在股骨软骨 3D 分割上获得: 82.2% Dice
而且 STCN 完全没有针对医学影像进行微调。作者因此认为,将视频中的时序传播思想迁移到 3D 医学图像切片传播是一个很有潜力的研究方向。