国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:李智涛,周之平,叶琴,
单位:南昌航空大学信息工程学院,南昌330063;
关键词:视觉问答,注意力机制,多模态学习,自注意力,空间推理注意力,
基金:国家自然科学基金资助项目(71761028);;
针对现有基于注意力机制的多模态学习,对文字上下文之间的自我联系和图像目标区域的空间位置关系进行了深入研究。在分析现有注意力网络的基础上,提出使用自注意力模块(self-attention,SA)和空间推理注意力模块(spatial reasoning attention,SRA)对文本信息和图像目标进行映射,最终得到融合特征输出。相较于其他注意力机制,SA和SRA可以更好地将文本信息匹配图像目标区域。模型在VQAv2数据集上进行训练和验证,并在VQAv2数据集上达到了64.01%的准确率。
来源:2021年第3期
《计算机应用研究》期刊编辑部