计算机应用

北大核心,INSPEC,JST,Pж(AJ),CSCD扩展版

国内刊号:51-1307/TP

国际刊号:1001-9081

计算机应用杂志2026年第1期:基于单目图像的多目标三维视觉定位方法

发布日期:

作者:黄舒雯, 郭柯宇, 宋翔宇, 韩锋, 孙士杰, 宋焕生

单位:1.长安大学 信息工程学院,西安 710064;2.长安大学 数据科学与人工智能研究院,西安 710064

关键词:三维视觉定位,单目图像,多模态技术,目标检测,场景理解

基金:国家重点研发计划项目(2023YFB4301800)

针对现有的三维视觉定位方法依赖昂贵传感器设备、系统成本高且在复杂多目标定位中准确度和鲁棒性不足的问题,提出一种基于单目图像的多目标三维视觉定位方法。该方法结合自然语言描述,在单个RGB图像中实现对多个三维目标的识别。为此,构建一个多目标视觉定位数据集Mmo3DRefer,并设计跨模态匹配网络TextVizNet。TextVizNet通过预训练的单目检测器生成目标的三维边界框,并借助信息融合模块与信息对齐模块实现视觉与语言信息的深度整合,进而实现文本指导下的多目标三维检测。与CORE-3DVG (Contextual Objects and RElations for 3D Visual Grounding)、3DVG-Transformer和Multi3DRefer (Multiple 3D object Referencing dataset and task)等5种方法对比的实验结果表明,与次优方法Multi3DRefer相比,TextVizNet在Mmo3DRefer数据集上的F1-score、精确度和召回率分别提升了8.92%、8.39%和9.57%,显著提升了复杂场景下基于文本的多目标定位精度,为自动驾驶和智能机器人等实际应用提供了有效支持。

来源:2026年第1期

《计算机应用》期刊编辑部

查看计算机应用杂志2026年第1期

联系我们

  • 地址:四川天府新区兴隆街道科智路1369号
  • 电话:028-85224283-803
  • E-mail:bjb@joca.cn

咨询工作人员