IPIU李硕博士、马梦茹博士获评陕西省/学会优秀博士学位论文

作者:时间:2026-01-16点击数:

近日,2025年度陕西省和中国电子教育学会优秀博士学位论文评选结果先后揭晓。实验室毕业生李硕博士(导师:刘芳教授)的博士学位论文入选陕西省优秀博士学位论文;马梦茹博士(导师:焦李成教授、马文萍教授)的博士学位论文入选中国电子教育学会优秀博士学位论文。截至目前,实验室共获得全国百篇优秀博士学位论文及提名、陕西省优秀博士学位论文及各学会优秀博士学位论文及提名39篇。


陕西省优秀博士学位论文获得者

李硕博士

李硕,博士,中共党员,在刘芳教授的指导下,于2023年6月获西安电子科技大学博士学位。现为西安电子科技大学人工智能学院全职博士后,合作导师焦李成教授,智能感知与图像理解教育部重点实验室(IPIU)成员,主持国自然青年基金、博士后面上基金、国家资助博士后研究人员计划、陕西省博士后科研项目资助等。博士学位论文获得2025年陕西省优秀博士学位论文、中国电子教育学会2024年度优秀博士学位论文提名奖、2025年陕西省计算机学会优秀博士学位论文、西安电子科技大学2025年校级优秀博士学位论文。主要从事人工智能算法研究,包括计算机视觉,深度学习,多模态学习,空间智能等,相关研究工作50余篇发表于CVPR、AAAI、ACM MM、ECCV、TIP、TCYB、TNNLS、TCSVT、TGRS和PR等领域内国际主流会议和期刊,共计被引800余次。


博士学位论文题目(中文/英文)

标签受限下的深度学习方法研究

Research on Deep Learning Methods Under Limited Labels

研究背景/选题来源

在现实世界中,非常容易获取大量的无标签或弱标签等标签受限的数据。随着研究的深入,如何有效利用这些标签受限的数据成为当前研究的热点。由于这些数据不具有完全的监督信息,在标签受限的情况下训练深度学习方法并取得与完全监督方法相当的性能是目前研究的难点,需要进行更加深入的研究和探索。

研究内容

博士学位论文聚焦标签受限下的深度学习方法研究与应用,采用大量易于获取的图像数据,以无监督、自监督或弱监督的训练模式,缓解深度学习模型对特定任务数据标注的依赖,通过简单有效的策略和方法来缩小标签受限的深度学习方法和完全监督的深度学习方法之间的性能差距。主要研究内容包括构建了一种自监督自组织聚类网络来学习图像的视觉表征;提出了一种从未标注的基类图像中构建任务的小样本图像分类方法;基于信息熵理论,提出了一种简单而有效的基于孪生架构的自监督表征学习方法;设计了一种基于学习显著特征的无监督显著目标检测方法,突破了现有方法需要额外模型来引入显著性信息的瓶颈;提出了一种基于线流的无监督视频运动信息稀疏表征框架并设计了一种与深度学习进行有机结合的方案;构建了一种以视频级标注为监督信号的弱监督视频异常检测方法等。

主要创新点

博士学位论文旨在面向计算机视觉中的基础视觉任务,在标签受限的情况下,研究如何利用现有的大量无标签或弱标签的数据,致力于缩小标签受限方法与完全监督方法之间的性能差距。主要创新包括:

(1)针对大量无标签的图像数据进行无监督表征学习的任务,受自组织映射网络的启发,提出了一种自监督自组织聚类网络来学习图像的视觉表征。该网络以自组织层的权重为聚类中心,通过自组织聚类头快速地计算出特征和聚类中心的相似性,并将该相似性转化为自监督伪标签,进而实现特征提取和特征聚类的联合优化。

(2)针对小样本图像分类中需要大量带标签的基类图像的问题,提出了一种从未标注的基类图像中构建任务的小样本图像分类方法。为了有效利用未标记的图像构建任务,提出了一种将图像特征学习到指定聚类空间中的深度聚类模型。该模型首先通过固定聚类中心来设置一个可分离的聚类空间,然后利用一个深度网络提取图像特征,最后通过设计的聚类头将图像特征学习到该聚类空间中。

(3)针对大量无标签的图像数据进行自监督表征学习的任务,基于信息熵理论,提出了一种简单而有效的基于孪生架构的自监督表征学习方法。从减少信息熵的角度来看,该方法以投影器的输出向量向其最近的最小熵靠近作为优化目标,其核心内容包括沿批次维度进行归一化以避免模型崩溃、计算最近的最小熵以获得优化目标以及计算对称损失并反向传播以优化网络等三个重要步骤。

(4)针对显著目标检测任务中存在获取像素级标注代价高的问题,提出了一种基于学习显著特征的无监督显著目标检测方法,突破了现有方法需要额外模型来引入显著性信息的瓶颈。该方法通过无监督的方式将图像特征分为属于显著目标的显著特征和不属于显著目标的非显著特征,并以增强显著特征和抑制非显著特征为优化函数,从数据本身中学习显著特征来实现无监督显著目标检测。

(5)针对视频中运动信息稀疏表征的任务,提出了一种基于线流的无监督视频运动信息稀疏表征框架,并设计了一种将该稀疏表征与深度学习进行有机结合的方案。在该稀疏表征框架中,将视频中的运动信息转化为获取运动素描线的求解问题,提出了利用具有稀疏表征特性的线流来建模视频中的运动信息。为了验证线流的有效性,首先通过神经网络提取代表运动信息的线流特征和代表表观信息的图像特征,然后根据线流所在的位置进行特征融合来丰富视频的特征。

(6)针对视频异常检测任务中较难获取帧级标注数据的问题,提出了一种以视频级标注为监督信号的弱监督视频异常检测方法。该方法利用视频中异常事件的连续性,以连续的多个视频片段作为优化单元,设计了一种基于Transformer的多序列学习网络,并构造了一个基于铰链的多序列学习排序损失函数。在训练过程中,进一步提出了一种自训练策略来逐步减少序列的长度,从而逐步细化异常得分。



中国电子教育学会优秀博士学位论文

获得者 马梦茹博士

马梦茹,博士,中共党员,在焦李成教授和马文萍教授的共同指导下,于2024年12月获西安电子科技大学博士学位。现为西安电子科技大学人工智能学院全职博士后、助理研究员,智能感知与图像理解教育部重点实验室(IPIU)成员。主要从事人工智能核心算法研究,包括机器视觉、深度学习、无监督学习、视觉语言模型、多模态学习等。目前在IEEE TNNLS、TGRS、TCSVT、TMM、JSTAR、Information Fusion和Artificial Intelligence Review等领域内国际主流期刊上发表了20余篇学术论文,并获得多项专利授权和软件著作权。主持了中国博士后科学基金面上项目、陕西省博士后科研项目资助、西安电子科技大学优秀博士学位论文资助基金项目等多项科研任务。同时,获得2023年和2024年博士研究生“国家奖学金”、2023年“盛路社会奖学金”、2024年“中国电子科技集团公司-西安电子科技大学协同创新奖学金”、2025年度中国电子教育学会优秀博士学位论文优秀奖等荣誉奖励。研究成果受到国内外学术界的广泛关注与肯定,多次被国际知名学者引用并给予高度评价,还受邀担任IEEE TNNLS、TCSVT、TGRS、Information Fusion、EAAI、AAAI等国际主流期刊和会议的审稿人。


博士学位论文题目(中文/英文)

空谱融合表征学习理论及遥感影像分类应用研究

The Spatial-Spectral Fusion Representation Learning and Remote Sensing Image Classification: Theory and Application

研究背景/选题来源

多模态遥感影像融合分类作为遥感技术的热点研究领域,通过整合光学影像、雷达影像、高光谱影像等多种数据源的信息,实现了对地表目标更全面、准确的分类与识别。这种方法不仅能有效缓解单一数据源存在的噪声和不确定性,还能有效利用不同数据源的互补信息并从多角度刻画地表信息的特征,扩展了遥感技术的应用范围,从而在城市规划、环境监测、灾害评估等领域展现出广阔的应用前景。同时,多模态遥感影像分类的研究也促进了数据处理、特征提取及分类算法等技术的持续创新与发展。尽管面临不同模态数据间的异构性、数据不平衡、特征提取与融合的复杂性以及大规模数据处理的计算开销等诸多挑战,但其为遥感科学与应用带来的变革与提升不容忽视,满足现代遥感应用对数据多样性、高精度和实时性的迫切需求,为相关领域的研究和应用提供了新的机遇。

研究内容

博士学位论文以高分辨率的多光谱和全色遥感影像为研究对象,深入探究了多模态数据融合在遥感图像分类任务中的应用。通过深入挖掘不同数据模态的特有特征,并充分利用机器学习与深度学习的强大特征提取能力,构建了一系列创新性的网络架构。这些架构包括:空谱渐进融合残差网络、自适应空谱迁移协同网络、空谱迁移表征学习融合网络、多模态空谱超融合Transformer网络、多模态均衡自学习空谱交互网络,以及具备可解释性的空谱交互学习融合网络,旨在实现对多模态遥感影像的准确、高效分类。

主要创新点

受生物神经网络的启发,深度神经网络模型在表征学习方面展现出卓越的能力,能够从海量遥感数据中自适应地提取深层、高维的特征表示,为多模态遥感影像解译带来了革命性的变革。博士学位论文以深度学习为核心,结合机器学习算法、遥感影像处理技术和认知科学理论,设计了基于表征学习的多模态遥感影像空谱超融合解译方法。主要的创新成果如下:

(1)针对多模态遥感影像中不同模态间显著的优势属性差异及直接融合方式简单粗暴的问题,提出了一个空谱渐进融合残差网络。该网络首先采用广义强度-色调-饱和度和离散小波变换结合的交互式数据融合策略,通过对原始影像进行多尺度分解、交互和重构,减小了模态间的信息差异。随后,在特征提取阶段,设计了自适应空间注意模块和自适应通道注意模块,分别增强了空间和光谱特征的表征能力。最后,将上述模块嵌入到残差网络中,利用融合分支提取的共有空谱特征,分别对全色分支和多光谱分支提取的特有特征进行参数逐步共享增强,实现了多模态信息的有效整合与利用。在多个实际场景数据和竞赛数据上的实验结果表明,空谱渐进融合残差网络能够在降低模态差异的同时实现特征的渐进融合表征,提高了分类精度。

(2)针对多模态遥感数据处理中表征差距显著、双支路特征空间异构的挑战,提出了一个自适应的空谱迁移协同网络。该网络通过结合主成分分析和非下采样轮廓波变换优化输入,实现了全色与多光谱影像间优势属性的相互迁移,在提升图像质量的同时缩小了表征差距。为了进一步对齐空间语义信息,设计了一种基于相关系数分析的特征渐进迁移融合单元。这使得网络自适应地学习需要共享和迁移的特征,进而降低了特征空间异构的差异。为了建模不同尺寸的目标与网络各层之间的依赖关系,引入了一种自适应层融合机制模块,它可以自适应融合不同层的特征。在真实公测数据上的实验表明,自适应的空谱迁移协同网络相较于非端到端的空谱渐进融合残差网络提高了2个百分点的精度。

(3)多模态遥感影像具有各自独特的优势掩膜,虽然它们表征相同的语义信息,却面临类内差异显著、类间差异相对较小的挑战,提出了一个空谱迁移表征学习融合网络。该网络在特征编码阶段引入双分支注意稀疏迁移模块,它结合空间和通道注意掩膜实现了全色和多光谱影像之间优势属性的相互迁移与增强。为处理多模态数据中的多尺度信息,深度双尺度分解模块能够将信息分解为高频和低频分量,并通过损失函数引导网络在保持互补多模态影像本征特征一致的同时,最大化边缘轮廓等细节差异。为了缓解类内差异大、类间差异小的问题,全局和局部特征重表征融合模块通过全局特征对类内局部特征进行排序与整合,使得相似的特征尽可能的聚类在一起,有效提升了特征的表征能力。在公测数据上的实验表明,基于空谱迁移表征学习的融合分类网络可以降低类内差异而增大类间差异,减少“斑点”分类结果。

(4)为了降低信息冗余,精准地捕捉通道间的顺序关系及空间局部位置关系,提出了一个多模态空谱超融合Transformer网络。该网络通过基于非负矩阵分解和自注意机制的子空间相似重组模块,对其自身的奇异特征和模态间的共有特征进行提取,缓解了多模态数据的冗余信息。同时,考虑到多光谱影像和全色影像具有不同的优势特性,针对不同的奇异特征,提出了可选择的自注意光谱特征提取器和多流Gist空间特征提取器。前者可以通过细化Transformer的输入,对多光谱影像的通道间序列信息进行表征。后者通过引入相对位置编码,对全色影像的空间特征进行建模,增强了对局部位置关系信息的捕获能力,从而提高了场景分类的精度。通过实验验证,多模态空谱超融合Transformer网络能够自动的学习子空间的最优特征,具有较好的分类精度。

(5)鉴于多模态分支间贡献不均衡以及源域与目标域间显著的空间差异,设计了一个多模态均衡自学习空谱交互网络。该网络通过构建双分支师生架构,并引入相似误差驱动的损失系数调整机制,实现了对不同模态特征的动态平衡。为了增强特征的表征能力与对比度,设计了一个纹理特征增强模块,该模块通过评估学生特征与之掩模间的相似度来生成增强特征,提升了特征的辨识力。在此基础上,为了进一步促进特征在源域和目标域之间的对齐,设计的特征融合模块巧妙利用学生网络对教师网络的反馈机制来支持更精细的聚类分析,通过无监督学习对有监督训练的指导来降低源域和目标域之间的空间差异。在多个数据集上的实验验证表明,多模态均衡自学习空谱交互网络可以针对不同模态设计不同的优化更新权重,实现少量标记样本下的高精度分类。

(6)为了优化模态共享特征的表征并有效降低训练与推理过程中的计算成本,提出了一个可解释的空谱交互学习融合网络。该网络首先聚焦于多光谱与全色影像中特有特征的提取,分别设计了模型驱动的光谱与空间特有特征提取器,将建模优化的迭代过程映射为相应的网络结构,提高了模型设计的可解释性。针对遥感影像特有的高分辨率特性,为了缓解深度神经网络在处理高分辨率影像时带来的计算负担,设计了一种具有仿射变换的空谱注意增强的可逆卷积神经网络。该网络在不需要存储额外信息的同时,通过可逆设计有效缓解了信息在传递过程中的损失问题。在实际场景数据和公共迁移数据上的实验结果表明,该方法能够以较少的参数量实现高精度分类,且具有很高的泛化性。

西安电子科技大学 智能感知与图像理解教育部重点实验室   版权所有   技术支持:西安聚力