近期,谢雪梅教授团队在IEEE TCSVT、IEEE TMM、PR等国际高水平期刊上发表了多篇创新研究成果。团队紧密围绕AI智能体感知世界、理解世界并与物理世界交互的核心挑战,提出了一系列新颖算法与模型,致力于让机器“看得更清”“想得更准”“做得更实”,为具身智能、人机交互等前沿应用提供了有力的技术支撑。以下为该团队近期七篇代表性工作的亮点介绍:
IEEE TCSVT
论文一
视觉物理环境中解决复杂问题的具身智能机器人
论文题目:Visual Environment-Interactive Planning for Embodied Complex-Question Answering
论文作者:兰宁,欧宝山,谢雪梅(通讯作者),石光明
作者单位:西安电子科技大学
论文概述:我们打造了一种真正“会思考、能行动”的具身智能机器人。它不再依赖一次性规划,而是边看环境、边理解问题、边调整行动。通过将语言理解与视觉感知对齐,机器人可以像人一样逐步拆解复杂问题,在真实空间中自主探索、定位目标并完成任务。无论是找物体、看细节还是多步推理,它都能实时决策、快速执行,不依赖重模型也能稳定运行。这种“感知-思考-行动”闭环,让机器人真正走出实验室,在复杂环境中高效干活。

论文二
具身智能体“边看边想”:一点即通知全貌
论文题目:Learning pyramid-structured long-range dependencies for 3d human pose estimation
论文作者:刘秀坤、兰宁、魏明杰、谢雪梅(通讯作者)、石光明
作者单位:西安电子科技大学
论文概述:我们提出SceneReasoner,让具身智能体真正“会联想、能推理”。面对真实环境中常见的感知缺失,它不再被动观察,而是像人一样结合经验边看边想:自动补全缺失信息,预演可行的行动方案。这种“边观察、边补全、边推演”的灵活能力,不仅让智能体摆脱了对完美感知与重模型的依赖,更以轻量化的推理代价,实现了更高效、更类人的场景理解与任务决策。

论文三
依据人体自然结构表达的人体姿态估计
论文题目:Human Pose Estimation via Parse Graph of Body Structure
论文作者:刘世帮,谢雪梅(通讯作者),石光明
作者单位:西安电子科技大学
论文概述:当观察人体时,人类能够提取一种称为解析图的结构化表示,其中包含从整体人体到局部部件及基础结构的层级分解关系,以及人体部件之间的上下文关系。这种能力有助于在不同层级上更加准确地定位人体结构。为使单人姿态估计模型具备类似能力,设计了一种层级化网络,通过卷积神经网络对人体结构解析图中的层级结构与上下文关系进行建模,从而弥补现有方法通常仅关注其中一方面的问题。该网络包含自底向上和自顶向下两个阶段。在自底向上阶段,模型从基础结构逐步聚合到局部部件及整体人体,以捕获层级结构特征;在自顶向下阶段,利用不同人体部件的上下文信息,对各层级结构特征进行逐级细化,实现从整体到局部的精细推理。

IEEE TMM
论文一
视觉场景图表达新方法:交互推理新能力
论文题目:Hierarchical Scene Graph Generation With Coarse-to-Fine Reasoning
论文作者:韩泽芳、刘秀坤、谢雪梅(通讯作者)、杨建秀、石光明
作者单位:西安电子科技大学
论文概述:我们提出层次化场景图生成,让模型真正“看得懂层次、理得清结构”。我们的方法像人一样从粗到细、逐层理解场景:先抓主干,再补细节,最后充实背景。这种“先概括、再聚焦、后补全”的层次化推理能力,能够以更精简的图结构承载更丰富的语义,同时在减少冗余的同时保留关键关系。这为视觉问答、具身导航等下游任务提供了高效紧凑的场景先验,让视觉语言交互推理更轻量、更可靠。

论文二
语言即思想:了解内容则可解决图像分割问题
论文题目:CMANet: Context-aware Mutual Attention Network for Referring Image Segmentation
论文作者:潘雄,谢雪梅(通讯作者),杨建秀,宋晓丹,石光明
作者单位:西安电子科技大学
论文概述:指代图像分割旨在依据自然语言描述实现对图像中特定目标的像素级分割。现有方法忽略了语言指令的全局语义表达,导致在实际多样化场景中的理解差。针对上述问题,我们提出上下文感知互注意力网络,通过联合语言的层级化语义信息,引导模型感知并定位目标。首先,构建语言词级特征与视觉特征之间的一致性,增强视觉表征与语言表征之间的语义相似性。随后,从语用学角度出发,提出上下文感知互注意力机制,利用语言的高层次目标语义表征引导视觉表征的理解,增强其在复杂多样化场景中的鲁棒性。在不同场景数据集上结果表明,该方法通过层次化语义引导方式,有效提高模型在不同场景以及语言描述下的分割性能。

论文三
可学习的整体结构相关3D人体姿态估计
论文题目:Learning pyramid-structured long-range dependencies for 3d human pose estimation
论文作者:魏明杰, 谢雪梅(通讯作者), 钟雨彤, 石光明
作者单位:西安电子科技大学
论文概述:在人体结构中,动作协调所体现的二维关节空间约束是恢复三维姿态的关键,其本质为身体部位间的长程依赖。然而,现有方法关节约束需身体部位层级调节,且通过加深网络学习非关联依赖会引入噪声并增加模型开销。为此,本文提出金字塔图注意力模块,将多尺度信息连接为紧凑序列并并行计算跨尺度相关性,以有效捕获关节与组之间的长程依赖;构建轻量级的金字塔图Transformer,将人体子结构聚合到自注意力机制中。同时,本文研究了扩散模型中二维条件对三维人体姿态的约束效果。综上,本文研究通过一种轻量化的方式高效地建模了三维人体姿态结构。

PR
论文一
人体姿态估计之视觉语言双模态交互
论文题目:Parse graph-based visual-language interaction for human pose estimation
论文作者:刘世帮,谢雪梅(通讯作者),石光明
作者单位:西安电子科技大学
论文概述:语言信息能够提供丰富的先验知识,例如人体部位间的空间关系,但现有基于全局特征的视觉-语言融合方法往往会削弱遮挡区域的响应,从而导致跨模态对齐与关键点定位误差。为此,我们提出一种基于解析图的视觉-语言交互方法(PGVL),其核心为一种新型引导模块(GM)。其中,低层节点用于保留局部特征,高层节点用于建模全局语义特征。PGVL 在 GM 的引导下,通过递归跨注意力机制执行层级化的自顶向下分解与自底向上组合过程。GM 利用高语义节点对经过跨注意力交互后的低语义节点进行特征更新引导,从而实现更加准确的跨模态融合。
