国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:冯欣,王俊杰,钟声,方婷婷,
单位:1.重庆理工大学计算机科学与工程学院,重庆400054;2.西南大学人工智能学院,重庆400715;
关键词:深度学习,图像分类,Transformer,局部注意力,基于语义的局部注意,
基金:重庆市自然科学基金面上项目(CSTB2022NSCQ-MSX0493);重庆市技术创新与应用发展重点项目(cstc2021jscx-dxwtBX0018);重庆理工大学研究生教育高质量发展项目(gzlcx20233200);;
在小数据集上从零开始训练时,视觉Transformer无法与同规模的卷积神经网络媲美。基于图像的局部注意力方法,可以显著提高ViT的数据效率,但是会丢失距离较远但相关的补丁之间的信息。为了解决上述问题,提出一种双向并行局部注意力视觉Transformer的方法。该方法首先在特征层面上对补丁进行分组,在组内执行局部注意力,以利用特征空间中补丁之间的关系弥补信息丢失。其次,为了有效融合补丁之间的信息,将基于语义的局部注意力和基于图像的局部注意力并行结合起来,通过双向自适应学习来增强ViT模型在小数据上的性能。实验结果表明,该方法在计算量为15.2 GFLOPs和参数量为57.2 M的情况下,分别在CIFAR-10和CIFAR-100数据集上实现了97.93%和85.80%的准确性。相比于其他方法,双向并行局部注意力视觉Transformer在增强局部引导能力的同时,保持了局部注意力所需属性的有效性。
来源:2025年第1期
《计算机应用研究》期刊编辑部