融合字典学习与视觉转换器的高分遥感影像场景分类方法
摘要
遥感影像场景分类方法多基于传统机器学习或卷积神经网络,此类方法的特征提取能力极为有限,尤其在处理类间相似度大、空间信息复杂、几何结构繁多的光学遥感影像时更容易出现特征信息丢失、分类精度受限等问题。基于此,提出一种融合字典学习与视觉转换器(ViT)的高分辨率遥感影像场景分类方法。该方法不仅能够挖掘图像内部的长距离依赖关系,而且可以利用字典学习抓取图像的深层非线性结构信息,从而达到提升分类准确度的目的。在PyTorch深度学习框架上,在RSSCN7、NWPU-RESISC45和Aerial Image Data Set(AID)3个公开的遥感影像数据集上对所提方法和模型进行了广泛实验,验证了所提方法的可行性,其分类正确率比原始视觉转换器模型分别高出1.763个百分点、1.321个百分点和3.704个百分点。与其他先进的场景分类方法相比,所提方法实现了更加优异的分类性能。
引用本文(GB/T 7714)
何晓军 He Xiaojun, 刘璇 Liu Xuan, 魏宪 Wei Xian. 融合字典学习与视觉转换器的高分遥感影像场景分类方法[J]. Laser & Optoelectronics Progress, 2023.
引文网络
本站仅收录题录与摘要供学习参考,全文版权归属出版方;如有侵权请联系我们删除。