[Sci Rep 2024]Spatial-temporal attention for video-based assessment of intraoperative surgical skill

目录
2.3.1. Supervised spatial attention
2.3.2. Multi-task learning baseline model
2.3.3. Unsupervised temporal attention
2.3.4. Integration with networks
2.4. Experiments and discussion
1. 心得
(1)每个模块都有多个选择,看起来有点混乱,主要是也没有给整个大图
2. 论文逐段精读
2.1. Abstract
①目的:开发和验证基于视频评估术中手术技能
novice n.新手;初学者;(修会等的)初学生;初学修士(或修女);尚未赢过大赛的赛马
2.2. Introduction
①基于视频的评估(Video-based assessment,VBA)可以有效评估手术技能
2.2.1. Related work
①技能评估方法:直接从视频、仪器运动、或相互作用
②第一行为有监督下的注意力图,第二列为无监督的:

2.3. Method
①使用从ImageNet预训练的ResNet-50,然后用线性映射把特征变换为注意力图
2.3.1. Supervised spatial attention
①空间注意力模块:

其中selection和aggregation只会选其中一种,时间特征是可选输入,SAMG是空间注意力,五个绿色方块是五层卷积层
②,其中
是高,
是宽,
是帧数。时空特征
是来源于LSTM的隐藏状态
③图中的计算步骤:
其中三个是不同的权重矩阵
④如果器械尖端落在像素点的CNN感受野范围内,
就计1
⑤损失函数:
其中
⑥提出的聚合操作:把特征图每个像素点乘上注意力权重:
⑦提出的选择操作:找出注意力值最大的像素点坐标:
然后取这个坐标的特征值:
2.3.2. Multi-task learning baseline model
①在上图添加关键点定位分支和损失
②计算高斯热图
2.3.3. Unsupervised temporal attention
①时间注意力机制:

LSTM每一帧隐藏状态,先用最后一帧隐藏态和所有帧算相似度,然后归一化这些相似度得到时间注意力,最后用注意力乘回特征
2.3.4. Integration with networks
①集成不同网络:CNN-LSTM、CNN-GRU、CNN-Transformer
2.3.5. No attention network
①无注意力机制:

其中空间注意力模块被平均聚合取代
2.4. Experiments and discussion
2.4.1. Dataset
①源数据集使用Video-based assessment of intraoperative surgical skill | International Journal of Computer Assisted Radiology and Surgery | Springer Nature Link和Objective assessment of intraoperative technical skill in capsulorhexis using videos of cataract surgery | International Journal of Computer Assisted Radiology and Surgery | Springer Nature Link的数据集,数据集包含99段白内障撕囊(capsulorhexis)视频,处理至640*480分辨率和59帧每秒,医生为撕囊评分2~5(Likert scale)
②目标数据集纳入51段统一机构但几年后采集的视频,不包含尖端注释
③数据集间统计差异:

④数据集标签差异

2.4.2. Data processing
①训练时每个视频采样256帧的片段:随机选定起始帧,然后每8帧采集一次,一直重复
②测试时采样三次片段,取平均
③数据正确:随机裁剪、色彩抖动、水平翻转和随机旋转(仪器尖端坐标一起变)
④模型实现:

⑤用Adam优化器,初始学习率为1e-3,批量大小为2,多任务批次为1
⑥解冻ResNet-50骨干网的最后一个块
⑦,
⑧交叉验证:五折
2.4.3. Results
①对比实验:

②消融实验:

③替换时间模型架构:

2.4.4. Discussion
①~
2.5. Conclusion
~
更多推荐



所有评论(0)