国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:姜丽梅,李秉龙,
单位:华北电力大学(保定)计算机系,河北保定071003;
关键词:多模态,架构,融合,轻量化,
基金:华北电力大学中央高校基本科研业务费专项资金资助项目(2022MS102);;
在深度学习领域,解决实际应用问题往往需要结合多种模态信息进行推理和决策,其中视觉和语言信息是交互过程中重要的两种模态。在诸多应用场景中,处理多模态任务往往面临着模型架构组织方式庞杂、训练方法效率低下等问题。综合以上问题,梳理了在图像文本多模态领域近五年的代表性成果。首先,从主流的多模态任务出发,介绍了相关文本和图像多模态数据集以及预训练目标。其次,考虑以Transformer为基础结构的视觉语言模型,结合特征提取方法,从多模态组织架构、跨模态融合方法等角度进行分析,总结比较不同处理策略的共性和差异性。然后从数据输入、结构组件等多角度介绍模型的轻量化方法。最后,对基于图像文本的多模态方法未来的研究方向进行了展望。
来源:2024年第5期
《计算机应用研究》期刊编辑部