中文引用格式: 樊泽,李鹏辉,赵皓阳,等. 基于PointMeta和上下文感知的点云场景理解[J]. 电子技术应用,2026,52(9):149-158.
英文引用格式: Fan Ze,Li Penghui,Zhao Haoyang,et al. Point cloud scene understanding based on PointMeta and context-awareness[J]. Application of Electronic Technique,2026,52(9):149-158.
引言
三维点云场景理解与自然语言处理的融合研究正推动新一代智能系统的发展。作为该领域的核心任务,三维视觉定位(3DVG)[1-2]需在点云中识别文本指定的目标物体(如“棕色木桌左侧的椅子”),而三维密集描述生成(3DDC)[3-4]则需为场景内每个物体生成精确的文本描述。这类任务在服务机器人AR/VR导航等场景中展现巨大潜力。
近年来,随着三维传感技术的快速发展,三维点云数据在自动驾驶、机器人导航、增强现实(AR)等领域得到了广泛应用。与二维图像相比,点云能够提供精确的几何结构和深度信息,从而更准确地描述物体的三维形状、姿态及空间分布。
然而,点云数据的稀疏性、非结构化特性以及复杂场景下的噪声干扰,使得点云场景理解仍然面临巨大挑战:首先,局部几何特征表达能力受限。主流方法如PointNet++依赖固定半径邻域聚合,难以捕捉薄壁结构等复杂拓扑。尽管Transformer架构(如X-Trans2Cap)通过自注意力机制提升全局建模能力,但其置换不变性缺失导致处理噪声点云时召回率降低。其次,跨模态语义对齐存在鸿沟。现有方法多采用简单特征拼接或浅层注意力融合,忽略语义与空间特征的协同优化。最后,上下文歧义导致描述偏差。语言中的方位描述与点云空间分布呈非线性映射关系,而现有方法缺乏可解释的关联建模。例如,“靠近窗户的沙发”可能对应多个候选区域,现有基线模型因此产生的误匹配率较高。
针对这些问题,本文提出了一种基于PointMeta和上下文感知的点云场景理解方法,旨在增强模型对局部结构、空间关系以及跨模态语义对齐的能力。具体而言,本文采用PointMeta作为视觉主干网络,利用其模块化设计和层次化特征提取机制,提升模型对点云局部结构和物体间空间关系的建模能力。同时,提出一种双流上下文感知的三维理解框架,从语义和空间两个维度优化点云与语言特征的跨模态融合。为了减少上下文特征与语言描述之间的歧义,进一步引入空间增强的文本标签,以提供更精确的监督信号。
本文的主要贡献可概括为:
(1) 提出一种层次化元架构,基于PointMeta进行点云特征提取,构建多尺度自适应特征提取网络实现多尺度特征自适应融合。
(2) 设计双流上下文感知的三维理解框架,从语义和上下文的角度对齐三维物体特征和语言特征,实现跨模态信息融合。
(3) 引入空间增强的文本标签,减少语义歧义,提高模型的鲁棒性。
本文详细内容请下载:
https://www.chinaaet.com/resource/share/2000007253
作者信息:
樊泽,李鹏辉,赵皓阳,赵文彬
(石家庄铁道大学 信息科学与技术学院,河北 石家庄 050043)

