国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:谷金晶,覃天宝,普园媛,翟祎乔,赵征鹏,
单位:1.云南大学a.信息学院;b.现代工学院,昆明650500;2.云南省高校物联网技术及应用重点实验室,昆明650500;3.云南省微光夜视探测及智能视觉导航重点实验室,昆明650500;
关键词:图像描述,检索,语义增强,多元高斯分布,
基金:国家自然科学基金资助项目(52102382);云南省基础研究计划面上项目(202501AT070234,202401CF070164);云南省教育厅科学研究基金资助项目(2025Y0008);云南大学研究生科学基金资助项目(KC-24249132);;
基于检索的图像描述能够利用丰富的外部先验文本知识,但现有研究仅将检索到的文本用作文本提示,视觉信息则完全依赖于CLIP视觉嵌入。这种方法的局限性在于,模型使用的文本提示信息未能充分表示到视觉嵌入空间。针对该问题,提出了ECSFCap模型,在编码阶段增强CLIP语义特征,进而指导语言模型在解码阶段生成高质量文本的图像描述。首先,将构建的文本信息和输入图像映射到CLIP空间,并变换到多元高斯分布,利用重参数采样法对两个多元高斯分布进行采样。随后,将采样结果、检索文本和视觉嵌入共同输入交叉编码器进行计算,这能有效融合不同模态的语义优势,从而得到增强的CLIP语义嵌入。大量实验表明,语义增强模块可以有效提升模型性能,模型仅需训练2.1 h即可获得122.9%的CIDEr评分和22.5%的SPICE评分。这是同等评价指标级别下训练时间很短的模型,展现了模型低训练成本的优势。
来源:2026年第3期
《计算机应用研究》期刊编辑部