首页 / 资料库 / 文献详情

一种融合视觉Transformer和扩散模型的单视点内窥镜手术光场重建方法(特邀)

韩晨明 Han Chenming吴高昌 Wu Gaochang

2024Laser & Optoelectronics ProgressComputer Science被引 3开放获取

出版方页面 →

摘要

针对内窥镜手术中单一视角图像深度估计不确定性与遮挡导致的手术场景三维感知难题,提出了一种融合视觉Transformer和条件扩散模型的单视点多平面图(MPI)表征方法,用以进行内窥镜手术光场重建。该方法首先利用视觉Transformer将输入的单视角图像令牌化,从而分解为多个图像块,并通过多头注意力机制提取局部与全局相结合的关联特征。然后,利用多尺度卷积解码器将图像块特征从粗到细进行重组与融合,生成初始MPI。最后,为了解决单视点内窥镜手术中组织之间的遮挡问题,引入了一个基于条件扩散模型的背景预测模块,根据初始MPI获取遮挡掩模,并以遮挡掩模和输入视角作为条件,预测被遮挡区域的分布,有效解决了单视点输入引起的光场内视角不连贯的问题。所提方法将基于视觉Transformer所分解的初始MPI与基于条件扩散模型预测的背景区域相结合,得到优化后的MPI,从而渲染出内窥镜手术光场中的各子视点图像。在达芬奇手术机器人的真实内窥镜手术数据集上的实验验证表明,所提方法在视觉和客观评价指标上均优于现有的单视图光场重建方法。

引用本文(GB/T 7714)

韩晨明 Han Chenming, 吴高昌 Wu Gaochang. 一种融合视觉Transformer和扩散模型的单视点内窥镜手术光场重建方法(特邀)[J]. Laser & Optoelectronics Progress, 2024.

引文网络

参考文献与被引分析加载中…

DOI:https://doi.org/10.3788/lop241272

本站仅收录题录与摘要供学习参考,全文版权归属出版方;如有侵权请联系我们删除。