《电子技术应用》
您所在的位置:首页 > 人工智能 > 设计应用 > 基于动态路径与局部视觉融合的图像描述生成
基于动态路径与局部视觉融合的图像描述生成
电子技术应用
王希萌,李鹏辉,赵皓阳,赵文彬
石家庄铁道大学 信息科学与技术学院
摘要: 图像描述生成旨在为图像生成语义连贯的文本描述。现有动态网络多局限于卷积核调整,缺乏空间多尺度与通道级建模,且跨层特征融合方式简单,难以挖掘层次间语义互补。为此,提出一种基于动态路径与局部视觉特征融合的图像描述生成模型。动态路径编码器通过空间与通道建模单元构建多层次路由空间,并基于空间-通道联合路由机制自适应分配路径权重,使网络结构能够依据输入图像动态调整。局部视觉融合模块通过跨层特征聚合增强语义互补。在MS-COCO数据集上的实验表明,该方法具有竞争性性能,验证了所提策略的有效性。
中图分类号:TP391.41 文献标志码:A DOI: 10.16157/j.issn.0258-7998.267774
中文引用格式: 王希萌,李鹏辉,赵皓阳,等. 基于动态路径与局部视觉融合的图像描述生成[J]. 电子技术应用,2026,52(7):124-132.
英文引用格式: Wang Ximeng,Li Penghui,Zhao Haoyang,et al. Image caption generation based on dynamic path and local vision fusion[J]. Application of Electronic Technique,2026,52(7):124-132.
Image caption generation based on dynamic path and local vision fusion
Wang Ximeng,Li Penghui,Zhao Haoyang,Zhao Wenbin
School of Information Science and Technology, Shijiazhuang Tiedao University
Abstract: Image caption generation aims to generate semantically coherent text descriptions for images. Existing dynamic networks are mostly limited to adjusting convolutional kernels, lacking spatial multi-scale and channel-level modeling, and the cross-layer feature fusion methods are simple, making it difficult to mine semantic complementarity between layers. To address these issues, this paper proposes an image caption generation model based on dynamic path and local visual fusion. The dynamic path encoder builds a multi-level routing space through spatial and channel modeling units and adaptively allocates path weights based on a spatial-channel joint routing mechanism, enabling the network structure to dynamically adjust according to the input image. The local visual fusion module enhances semantic complementarity through cross-layer feature aggregation. Experiments on the MS-COCO dataset demonstrate that the proposed method has competitive performance, verifying the effectiveness of the proposed strategy.
Key words : image caption generation;dynamic path;spatial-channel joint routing;local visual fusion

引言

图像描述生成[1]作为计算机视觉与自然语言处理交叉领域的重要研究方向,旨在构建视觉内容与语义文本之间的跨模态映射桥梁,其核心目标是使人工智能系统具备人类水平的图像理解与语言表达能力。该任务不仅要求模型准确识别图像中的实体对象,还需深入解析目标间的空间关系、动作关联及场景上下文信息,以实现对视觉内容的深度语义表征与自然语言描述。

近年来,以卷积神经网络[2](CNN)和Transformer[3]为代表的深度学习模型在图像描述生成[4]、视觉问答(VQA)[5]等跨模态任务中表现出色。然而,面对复杂场景下的动态语义建模与多尺度特征融合问题,现有方法仍存在明显不足。当前主流的动态网络架构方法[6]多围绕卷积核的动态调整展开。尽管此类设计在一定程度上增强了模型对输入数据的自适应性,但仍存在两大关键缺陷:其一,过度关注卷积操作的动态化,而忽视了空间多尺度特征与通道信息的协同建模,导致模型难以充分捕捉多尺度视觉语义信息;其二,部分方法将所有候选模块置于统一路由空间,引发路由效率低下的问题。此外,在跨层特征融合方面,现有方法普遍采用特征拼接或加权求和等简单策略,难以深入挖掘不同层次特征间的语义互补性,限制了模型对全局语义与局部细节的协同表征能力。

针对上述挑战,本文提出一种基于动态路径局部视觉融合的图像描述生成模型(DP-LVF)。该模型创新性地设计了动态路径编码器,通过引入空间上下文建模单元与通道注意力建模单元,分别对输入样本的空间多尺度特征与通道信息进行建模,从而构建层次化、多维度的路由空间。在此基础上,采用空间-通道联合路由机制,通过自适应权重分配为不同样本动态分配定制化路径,显著提升了模型对多尺度目标的表征能力与计算效率。同时,本文设计了局部视觉融合模块,通过构建跨层特征聚合网络整合不同编码器层的特征表示,实现全局语义与局部细节的互补增强,有效提升了模型对复杂场景的语义解析能力。

本文在MS-COCO标准数据集上进行了系统实验。结果表明,与现有先进方法相比,本文方法在CIDEr-D、METEOR、BLEU等核心评价指标上均有提升。特别地,与BLIP、OFA等大型视觉语言模型相比,本文方法在保持竞争性性能的同时,显著降低了计算开销,更适合实际部署场景。消融实验验证了动态路径与局部视觉融合策略在复杂场景语义解析与关系推理任务中的有效性与优越性。

本文的主要贡献包括:

(1)提出了一种空间-通道联合路由(SCJR)机制,突破了传统动态路由仅基于单域建模的局限,将空间和通道特征联合建模,实现了跨域路径的自适应选择,从而在复杂场景中具备更强的动态表达能力。

(2)提出了一种局部视觉融合(LVF)模块,不仅实现跨层特征聚合,还通过空间偏移操作增强了局部区域的语义对齐。与常规的特征拼接或加权求和不同,LVF能够在空间与通道维度同时实现细粒度交互,显著提升特征融合的有效性。

(3)在MS-COCO数据集上验证了所提方法的有效性,实验结果表明其在生成准确性与语义丰富性方面优于现有技术,同时在效率上显著优于大型视觉语言模型。


本文详细内容请下载:

http://www.chinaaet.com/resource/share/2000007151


作者信息:

王希萌,李鹏辉,赵皓阳,赵文彬

(石家庄铁道大学 信息科学与技术学院,河北 石家庄 050043)

2.jpg

此内容为AET网站原创,未经授权禁止转载。