国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:邱南,顾玉宛,石林,李宁,庄丽华,徐守坤,
单位:常州大学计算机与人工智能学院阿里云大数据学院,江苏常州213164;
关键词:视觉问答,复合视觉语言特征,区域特征,多模态融合,
基金:国家自然科学基金资助项目(61906021);常州市城市大数据分析与应用技术重点实验室资助项目(CM20193007);江苏省研究生科研创新计划资助项目(KYCX21-2829);;
针对当前主流视觉问答(visual question answering,VQA)任务使用区域特征作为图像表示而面临的训练复杂度高、推理速度慢等问题,提出一种基于复合视觉语言的卷积网络(composite visionlinguistic convnet,CVlCN)来对视觉问答任务中的图像进行表征。该方法将图像特征和问题语义通过复合学习表示成复合图文特征,然后从空间和通道上计算复合图文特征的注意力分布,以选择性地保留与问题语义相关的视觉信息。在VQA-v2数据集上的测试结果表明,该方法在视觉问答任务上的准确率有明显的提升,整体准确率达到64.4%。模型的计算复杂度较低且推理速度更快。
来源:2021年第8期
《计算机应用研究》期刊编辑部