国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:马坤阳,林金朝,庞宇,
单位:重庆邮电大学光电信息感测与传输技术重庆市重点实验室,重庆400065;
关键词:图像描述,多示例学习,引导解码,视觉注意力机制,
基金:国家自然科学基金资助项目(61471075,61671091);重庆科委自然科学基金资助项目(cstc2016jcyjA0347);重庆高校创新团队建设计划资助项目;;
针对输入的图像视觉信息不能在每一步解码过程中动态调整,同时为了提高图像语义描述模型的精度和泛化能力,提出了一种结合引导解码和视觉注意力机制的双层长短时记忆(long short term memory,LSTM)网络的图像语义描述模型。将提取到的图像的视觉和目标特征通过一个引导网络建模后送入LSTM网络的每一时刻,实现端到端的训练过程;同时设计了基于图像通道特征的视觉注意力机制,提高了模型对图像细节部分的描述。利用MSCOCO和Flickr30k数据集对模型进行了训练和测试,结果显示模型性能在不同的评价指标上都得到了提升。
来源:2020年第11期
《计算机应用研究》期刊编辑部