基于体素自注意力辅助网络的三维目标检测
摘要
针对目前依赖于卷积神经网络(CNN)的激光雷达目标检测算法对自动驾驶场景的空间结构理解不深刻导致检测效果差的问题,提出了一种能够增强特征提取能力、可直接应用于大部分基于体素的检测算法的体素自注意力辅助(VSAA)网络。首先,VSAA网络在体素特征编码的基础上进一步构造体素哈希表对体素进行二次编码,在后续自注意力计算过程中有效提高了搜索相关体素的效率;然后,VSAA网络将自注意力机制应用到体素层面,从而获取到丰富的全局信息和深层次的上下文语义信息;最后,将VSAA网络应用在基准算法SECOND和PV-RCNN上,进而提出了VA-SECOND和VA-PVRCNN算法,并通过融合VSAA网络与CNN特征弥补了CNN感受野小的缺点,增强了检测算法对整个空间场景的理解能力。在KITTI数据集上的实验结果表明:相比于基准算法,VA-SECOND和VA-PVRCNN算法对所有检测目标的平均检测精度分别提高了1.16百分点和1.54百分点,证明了VSAA网络的有效性。
引用本文(GB/T 7714)
曹捷 Cao Jie, 彭忆强 Peng Yiqiang, 樊利康 Fan Likang, 等. 基于体素自注意力辅助网络的三维目标检测[J]. Laser & Optoelectronics Progress, 2024.
引文网络
本站仅收录题录与摘要供学习参考,全文版权归属出版方;如有侵权请联系我们删除。