国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:冯广,刘天翔,杨燕茹,郑润庭,钟婷,林健忠,黄荣灿,
单位:广东工业大学a.自动化学院;b.计算机学院,广州510006;
关键词:多模态命名实体识别,语义对齐偏差,语义增强,模态协同,注意力机制,
基金:国家自然科学基金重点项目(62237001);广东省哲学社会科学青年项目(GD23YJY08);;
多模态命名实体识别(MNER)旨在结合文本和图像等信息,提高命名实体识别的准确性。然而,现有方法因文本表达不规范以及图像特征提取聚焦于局部信息,导致图文语义特征利用不充分。针对该问题,提出了一种图文协同层级融合(VTCHF)的命名实体识别模型,不仅利用全局视觉特征来补充视觉语义,还通过协同自变分编码器充分利用图像与文本特征,协同生成包含视觉语境信息的特征,从而增补文本语义。随后,设计了层级融合模块,预融合图文特征及其语义特征,自适应增强图文语义粒度,缓解后续模态融合中的对齐偏差。在多个公开数据集上的实验结果表明,该模型显著提升了命名实体识别的准确率、召回率和F1值,验证了其优越的性能。
来源:2025年第8期
《计算机应用研究》期刊编辑部