国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:刘杰,乔文昇,朱佩佩,雷印杰,王紫轩,
单位:1.中国西南电子技术研究所,成都610036;2.电子科技大学资源与环境学院,成都611731;3.四川大学电子信息学院,成都610065;
关键词:零样本,CLIP,像素级,单阶段,参考图像分割,
基金:国家自然科学基金资助项目(62303433);;
近年来,以CLIP为代表的视觉-语言大模型在众多下游场景中显示出了出色的零样本推理能力,然而将CLIP模型迁移至需要像素水平图-文理解的参考图像分割中非常困难,其根本原因在于CLIP关注图像-文本整体上的对齐情况,却丢弃了图像中像素点的空间位置信息。鉴于此,以CLIP为基础模型,提出了一种单阶段、细粒度、多层次的零样本参考图像分割模型PixelCLIP。具体地,采取了多尺度的图像特征融合,既聚集CLIP中不同视觉编码器提取的图像像素级特征,同时又考虑CLIP中固有的图像整体语义特征。在文本信息表征上,不但依靠CLIP-BERT来保持物体种类信息,还引入LLaVA大语言模型进一步注入上下文背景知识。最后,PixelCLIP通过细粒度跨模态关联匹配,实现像素水平的参考图像分割。充分的数值分析结果验证了该方法的有效性。
来源:2025年第4期
《计算机应用研究》期刊编辑部