国内刊号:51-1196/TP
国际刊号:1001-3695
发布日期:
作者:罗寒,马浩统,刘杰,严华,雷印杰,
单位:1.四川大学电子信息学院,成都610065;2.中国科学院光电技术研究所中国科学院光束控制重点实验室,成都610209;3.中国电子科技集团公司第十研究所航空电子信息系统技术重点实验室,成都610036;
关键词:3D视觉定位,多模态,特征一致性约束,局部关系,全局位置信息,
基金:国家自然科学基金面上项目(62276176);;
3D多模态数据稀缺,使得传统方法进行监督训练时文本与视觉特征缺乏语义一致性。同时传统方法还易忽视局部关系与全局信息,从而导致性能不佳。针对上述问题,提出了一种基于语义一致性约束与局部-全局感知的多模态3D视觉定位方法。首先,该方法通过蒸馏2D预训练视觉语言模型知识,帮助3D模型提取到点云-文本语义一致性特征;其次设计了局部-全局感知模块,不断补充增强候选目标特征,以更精确匹配目标。在现有的3D视觉定位数据集ScanRefer上进行的实验表明,该方法在Acc@0.25 IoU和Acc@0.5 IoU两个指标上分别达到了50.53%和37.67%,超越了现有大多数3D视觉定位算法,证实了该方法的有效性。
来源:2024年第7期
《计算机应用研究》期刊编辑部