国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:张明,曾青松,郑昕璇,
单位:武汉工程大学计算机科学与工程学院人工智能学院,武汉430205;
关键词:跨模态对齐,细粒度语义对齐,语义-空间融合,动态特征聚合,视觉Transformer,
基金:珠海市产学研合作项目(2320004002605);;
跨模态语义对齐是实现图像检索等任务的核心技术。传统方法依赖预训练目标检测器,存在计算冗余与误差传播问题;而基于图像块的视觉Transformer易受语义模糊与冗余干扰,导致视觉对象结构破碎、难以与文本实体建立精准关联。为此,提出语义-空间约束融合策略,在不依赖检测器的情况下实现语义精度与空间保真度统一的细粒度对齐。该方法通过视觉端语义-空间块校准模块构建双重约束,动态聚合语义一致且空间相邻的视觉块,生成紧凑对象级token表征;文本端采用实体感知分词将命名实体作为完整语义单元。在Flickr30K和MS-COCO数据集上的实验表明,该方法在图文双向检索任务中均取得显著提升,rSum指标较主流方法提高3~5点。研究证实,语义与空间双重约束下的对象级token重构能有效增强跨模态对齐的鲁棒性与判别力,为细粒度跨模态理解提供了新路径。
来源:2026年第5期
《计算机应用研究》期刊编辑部