基于特征融合与集成学习的细粒度图像分类
摘要
细粒度图像分类旨在准确分类给定超类的子类别,面临类内差异大、类间差异小和训练样本有限等挑战。目前,大多数方法基于Vision Transformer进行改进以提升分类性能,但仍存在一些问题:忽略不同层次分类令牌的互补信息导致全局特征提取不完整,多头自注意力机制中不同头部表现不一致导致局部定位不准确,以及有限训练样本易过拟合。基于此,提出一种基于特征融合与集成学习的细粒度图像分类网络,该网络包含3个模块:多层次特征融合模块融合互补信息以获取更完整的全局特征,多专家局部投票模块基于集成学习投票定位局部令牌以增强局部特征表示能力,注意力引导的混合增强模块缓解过拟合问题,提高分类准确性。所提网络在CUB-200-2011、Stanford Dogs、NABirds和IP102等数据集上的分类精度分别为91.92%、93.10%、90.98%和76.21%,相较原始Vision Transformer模型分别提高1.42百分点、1.50百分点、1.08百分点和2.81百分点,优于其他对比细粒度图像分类模型。
引用本文(GB/T 7714)
张文丽 Zhang Wenli, 宋威 Song Wei. 基于特征融合与集成学习的细粒度图像分类[J]. Laser & Optoelectronics Progress, 2024.
引文网络
本站仅收录题录与摘要供学习参考,全文版权归属出版方;如有侵权请联系我们删除。