计算机应用研究

北大核心,JST,Pж(AJ),CSCD扩展版,WJCI

国内刊号:51-1196/TP

国际刊号:1001-3695

计算机应用研究杂志2025年第7期:基于CLIP文本特征增强的剪纸图像分类

发布日期:

作者:张新生,陈鼎,秦一冰,

单位:西安建筑科技大学a.信息与控制工程学院;b.管理学院,西安710055;

关键词:视觉语言大模型,剪纸分类,小样本分类,模态融合,提示学习,

基金:陕西省重点产业链(群)创新项目(2022ZDLGY06-04);泛在信息社会下AI生成式虚假信息风险感知及治理路径研究教育部人文社科规划基金项目(24YJA630129);AIGC时代下生成式虚假信息风险感知及治理路径研究陕西省社会科学基金项目(2024R083);;

针对剪纸图像分类中文本与图像模态差异大、类原型表达能力弱的问题,提出了一种基于CLIP模型的文本特征增强方法(CLIP visual text enhancer,C-VTE)。该方法通过人工提示模板提取文本特征,设计了一种视觉文本增强模块,并利用Cross Attention和比例残差进行连接和融合图像特征与文本特征,以减小模态差异,增强类别特征表达能力。在剪纸数据集及Caltech101等4个公开数据集上进行了实验,验证其有效性:在剪纸数据集的基类分类任务中,C-VTE平均准确率达到了72.51%,较现有方法提升3.14百分点;在公开数据集的小样本分类任务中,平均准确率达到了84.78%,提升2.45百分点。消融实验表明,模态融合模块与比例残差对性能提升影响显著。该方法为视觉语言大模型在下游分类任务中的高效适配提供了新思路,尤其适用于小样本与基类主导的场景。

来源:2025年第7期

《计算机应用研究》期刊编辑部

查看计算机应用研究杂志2025年第7期

联系我们

  • 地址:四川省成都市武候区成科西路3号
  • 电话:028-85249567
  • E-mail:journal@arocmag.cn

咨询工作人员