论文网址:Spatial-temporal attention for video-based assessment of intraoperative surgical skill | Scientific Reports

目录

1. 心得

2. 论文逐段精读

2.1. Abstract

2.2. Introduction

2.2.1. Related work

2.3. Method

2.3.1. Supervised spatial attention

2.3.2. Multi-task learning baseline model

2.3.3. Unsupervised temporal attention

2.3.4. Integration with networks

2.3.5. No attention network

2.4. Experiments and discussion

2.4.1. Dataset

2.4.2. Data processing

2.4.3. Results

2.4.4. Discussion

2.5. Conclusion

1. 心得

(1)每个模块都有多个选择,看起来有点混乱,主要是也没有给整个大图

2. 论文逐段精读

2.1. Abstract

        ①目的:开发和验证基于视频评估术中手术技能

novice  n.新手;初学者;(修会等的)初学生;初学修士(或修女);尚未赢过大赛的赛马

2.2. Introduction

        ①基于视频的评估(Video-based assessment,VBA)可以有效评估手术技能

2.2.1. Related work

        ①技能评估方法:直接从视频、仪器运动、或相互作用

        ②第一行为有监督下的注意力图,第二列为无监督的:

2.3. Method

        ①使用从ImageNet预训练的ResNet-50,然后用线性映射把特征变换为注意力图

2.3.1. Supervised spatial attention

        ①空间注意力模块:

其中selection和aggregation只会选其中一种,时间特征\mathbf{h}_i是可选输入,SAMG是空间注意力,五个绿色方块是五层卷积层

        ②x_i = \{p_{i,m,n}\},其中m \in[1,H]是高,n \in[1,W]是宽,i \in [1,N]是帧数。时空特征\mathbf{h}_i是来源于LSTM的隐藏状态

        ③图中的计算步骤:

f_{\text{appearance}} = \mathbf{M}_a \mathbf{p}_{i,m,n} \\ f_{\text{spatio-temporal}} = \mathbf{M}_s \mathbf{h}_i \\ f_{m,n}^{\text{overall}} = \mathbf{M}_o \sigma\left( f_{\text{appearance}} + f_{\text{spatio-temporal}} \right) \\ att_{m,n}^{\text{spatial}} = \frac{\exp\left( f_{m,n}^{\text{overall}} \right)}{\sum_{m,n} \exp\left( f_{m,n}^{\text{overall}} \right)}

其中三个\mathbf{M}是不同的权重矩阵

        ④如果器械尖端落在像素点m,n的CNN感受野范围内,b_{m,n}就计1

\forall b_{m,n} \in \mathbf{B}_i,\quad b_{m,n} = \begin{cases} 1 & \text{if } \sum_{k} s_{k,m,n} \geq 1 \\ 0 & \text{otherwise} \end{cases}

        ⑤损失函数:

L = L_{BCE} + \lambda \cdot L_{Dice}

其中\lambda=0.5

        ⑥提出的聚合操作:把特征图每个像素点乘上注意力权重:

\mathbf{x}_i^{att} = \sum \widetilde{\mathbf{x}}_i = \sum \mathbf{A}_i^{spatial} \cdot \mathbf{x}_i

        ⑦提出的选择操作:找出注意力值最大的像素点坐标:

\hat{m}, \hat{n} = \arg\max_{m,n} \left( \left\{ a_{m,n}^{spatial} \mid a_{m,n}^{spatial} \in \mathbf{A}_i^{spatial} \right\} \right)

然后取这个坐标的特征值:

\mathbf{x}_i^{att} = \mathbf{p}_{\hat{m},\hat{n}}

2.3.2. Multi-task learning baseline model

        ①在上图添加关键点定位分支和损失

        ②计算高斯热图

2.3.3. Unsupervised temporal attention

        ①时间注意力机制:

LSTM每一帧隐藏状态\mathbf{H} = \{\mathbf{h}_1, \mathbf{h}_2, \dots, \mathbf{h}_N\},先用最后一帧隐藏态和所有帧算相似度,然后归一化这些相似度得到时间注意力,最后用注意力乘回特征

\beta = \mathbf{H} \mathbf{h}_N \\ \forall i \in [1, N],\quad \mathbf{A}_i^{temp} = \frac{\exp(\beta_i)}{\sum_{i \in [1,N]} \exp(\beta_i)} \\ \mathbf{h}_f = (\mathbf{A}^{temp})^T \mathbf{H}

2.3.4. Integration with networks

        ①集成不同网络:CNN-LSTM、CNN-GRU、CNN-Transformer

2.3.5. No attention network

        ①无注意力机制:

其中空间注意力模块被平均聚合取代

2.4. Experiments and discussion

2.4.1. Dataset

        ①源数据集使用Video-based assessment of intraoperative surgical skill | International Journal of Computer Assisted Radiology and Surgery | Springer Nature LinkObjective assessment of intraoperative technical skill in capsulorhexis using videos of cataract surgery | International Journal of Computer Assisted Radiology and Surgery | Springer Nature Link的数据集,数据集包含99段白内障撕囊(capsulorhexis)视频,处理至640*480分辨率和59帧每秒,医生为撕囊评分2~5(Likert scale)

        ②目标数据集纳入51段统一机构但几年后采集的视频,不包含尖端注释

        ③数据集间统计差异:

        ④数据集标签差异

2.4.2. Data processing

        ①训练时每个视频采样256帧的片段:随机选定起始帧,然后每8帧采集一次,一直重复

        ②测试时采样三次片段,取平均

        ③数据正确:随机裁剪、色彩抖动、水平翻转和随机旋转(仪器尖端坐标一起变)

        ④模型实现:

        ⑤用Adam优化器,初始学习率为1e-3,批量大小为2,多任务批次为1

        ⑥解冻ResNet-50骨干网的最后一个块

        ⑦C_e=2048C_h=1024

        ⑧交叉验证:五折

2.4.3. Results

        ①对比实验:

        ②消融实验:

        ③替换时间模型架构:

2.4.4. Discussion

        ①~

2.5. Conclusion

        ~

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐