近日,IEEE国际计算机视觉与模式识别会议 (IEEE Conference on Computer Vision and Pattern Recognition,简称CVPR)、第十四届国际学习表征会议(The Fourteenth International Conference on Learning Representations,简称ICLR)及IEEE模式分析与机器智能汇刊(IEEE Transactions on Pattern Analysis and Machine Intelligence,简称TPAMI)确认录用结果,实验室共有13篇论文被CVPR 2026录用,5篇论文被ICLR 2026录用,2篇论文被TPAMI录用。
CVPR 2026录用论文中,第一作者分别是柴金铭博士生(导师:焦李成教授),李瑞阳博士生、张超硕士生(导师:刘芳教授),吕崇华博士生(导师:王爽教授),徐俊伟博士生(导师:董伟生教授),杨智超博士生(导师:李雷达教授),李奥博博士生、胡睿博士生与吴淞博士生(共同第一作者)、陈志文博士生(导师:吴金建教授),石光辉博士生(导师:梁雪峰教授),杨玉壮硕士生(导师:田小林教授),韩硕博士生(导师:唐旭教授),杨麒瞳硕士生(导师:冯明涛副教授)。ICLR 2026录用论文中,第一作者分别是王超博士(合作导师:焦李成教授),张潇文博士生(导师:焦李成教授),曹显伟博士生(导师:王爽教授),刘少禹博士生(导师:赵光辉教授),董乐副教授。TPAMI录用论文中,第一作者分别是吴文铭博士(合作导师:焦李成教授),柴金铭博士生(导师:焦李成教授)。论文简要介绍如下:
01 CVPR 2026 录用论文
论文一
论文题目:RECS4R: Bridging Semantics and Geometry for Referring Remote Sensing Interpretation
论文作者:柴金铭,李玲玲,焦李成,路小强,孙龙,刘旭,马文萍,李卫斌
作者单位:西安电子科技大学
论文概述:参考表达理解与分割(RECS)任务因其在多任务处理中的高效性,在遥感领域发挥着重要作用。目标特征的高精度表征是实现下游任务准确解译的重大前提,然而,视觉定位(VG)与参考图像分割(RIS)分别侧重几何与语义等不同特征,导致多任务学习中优化目标不统一,进而产生表征方向割裂问题,导致表征能力受限。尽管现有方法(如 PolyFormer)已在“数据表示层”引入多边形点进行改善,但仍需在解码时分别预测分割与检测顶点,未能实现真正的优化目标统一。我们发现,寻找统一的中间媒介以承载目标优化是打破表征割裂的关键。因此,我们提出 RECS4R,一种以目标轮廓为统一优化目标表示的多任务解码范式,为多任务间“语义&几何表征鸿沟”构建统一桥梁。在“特征优化层”构建贯穿模型全维度的解决方案(4R):在 Representation 层,引入语言引导的统一轮廓解码范式,以目标轮廓作为统一中间载体同步优化 VG 与 RIS,在结构上保持几何与语义一致性,实现轻量高效解码;在 Refinement 层,设计残差编码器,将 Coarse 阶段特征以残差注入 Fine 阶段,使其由“从零再学”转为“纠偏 + 精化”;在 Reaggregation 层,设计通道隔离多尺度融合模块,实现通道间无损特征融合;在 Regularization 层,采用梯度一致性损失提升边界贴合度。在遥感与自然等六个数据集上验证模型泛化性,并在 CNN、Transformer 及 Mamba 不同主干网络下验证模型稳定性,结果表明 RECS4R 取得优异性能。

论文二
论文题目:Delving Aleatoric Uncertainty in Medical Image Segmentation via Vision Foundation Models
论文作者:李瑞阳,刘芳,焦李成,谢兴霖,郝佳瑶,李硕,刘旭,杨静怡,李玲玲,陈璞花,马文萍
作者单位:西安电子科技大学
论文概述:医学影像分割通过精确划分解剖结构与病灶,为临床工作流提供关键支撑。然而,医学影像数据集在采集与标注过程中普遍存在噪声干扰与不确定性,导致数据不确定性的普遍存在,严重影响模型学习的鲁棒性。当前研究多聚焦于模型结构优化与预测可靠性估计,却缺乏对数据本身不确定性的系统性探索。为此,本文提出基于大规模预训练视觉基础模型的通用表征能力,来估计数据中的固有不确定性。具体而言,我们通过分析模型解码的特征多样性并量化其奇异值能量分布来定义每个类别的语义感知尺度,以衡量样本难度及其随机不确定性。基于此,本文设计了两种基于不确定驱动的应用策略:(1)构建随机不确定性感知的数据过滤机制,以筛除潜在噪声样本并提升模型学习质量;(2)提出动态不确定性感知优化策略,通过训练过程中模型的语义感知尺度以动态自适应调整类别损失权重并结合标签去噪机制增强训练稳定性。在涵盖CT与MRI模态、涉及多器官与肿瘤分割任务的五个公开数据集上的实验结果表明,本文方法在CNN、Transformer与Mamba等多种主流网络架构中均实现了显著且稳健的性能提升,揭示了随机不确定性在医学影像理解与分割任务中的广泛应用潜力。

论文三
论文题目:VDFE: Difference-Aware 3D Scene Editing with Non-Intrusive Video Diffusion Priors for Multi-View Consistency and Efficiency
论文作者:张超,刘芳,李硕,刘洋,王佳豪,黄欣妍,李玲玲,陈璞花,刘旭,马文萍,尉思琪
作者单位:西安电子科技大学
论文概述:随着NeRF 和 3D 高斯等 3D 重建技术的持续进步,文本驱动的 3D 场景编辑旨在提供更加直观的场景定制。然而,现有方法在可控性和一致性方面常常存在局限性。为了解决这些问题,我们提出了 VDFE,这是一种基于非侵入式利用预训练视频扩散先验的差异感知 3D 场景编辑方法,它集成了最优控制引导流编辑(FlowOCE)、解耦流差异(DFD)和差异感知高斯编辑(DAGE)三部分。具体而言,FlowOCE 将编辑过程视为最优控制问题,依托视频扩散模型的时空建模能力提取原始数据的时空特征并将其作为编辑控制信号,优化无噪声的编辑轨迹以最小化非目标区域的意外修改和生成多视角一致、过渡平滑的编辑结果;DFD 创新性地通过分析流差异获取相较于交叉注意力更加精确地定位编辑区域,为后续的优化过程提供定位先验;DAGE 利用定位信息选择性地更新 3D 高斯分布,以实现高效且精确的细化。大量实验表明,我们的方法在定性和定量评估中均显著优于现有方法,达到了最先进的(SOTA)性能。

论文四
论文题目:Generalizable Knowledge Distillation from Vision Foundation Models for Semantic Segmentation
论文作者:吕崇华,赵栋,王爽,权豆,呼延宁,Nicu Sebe,钟准
作者单位:西安电子科技大学,特伦托大学,合肥工业大学
论文概述: 知识蒸馏KD是压缩大型模型以获得轻量化模型的重要手段,广泛用于语义分割等密集预测任务。然而,传统KD方法主要侧重于保持域内精度,而忽略了域外泛化能力,导致轻量化后的模型在数据分布发生变化时性能显著下降。随着视觉基础模型VFM的兴起,这一问题变得更加突出:VFM通常在未见过的数据上表现出很强的鲁棒性,但使用传统的KD方法进行蒸馏时往往会损害这种能力。为了解决这个问题,我们提出了一种可泛化知识蒸馏GKD的多阶段框架,旨在显式地增强小模型的泛化能力。GKD将表征学习与任务学习解耦。在第一阶段,学生模型通过选择性特征蒸馏获得与领域无关的表征;在第二阶段,这些表征被冻结以适应任务,从而缓解对可见域的过拟合。此外,我们引入了一种基于查询的软蒸馏机制,其中学生模型的特征作为查询,向教师模型的表征选择性地提取可迁移的空间知识。在五个领域泛化基准测试上进行了大量实验,GKD 始终优于现有的 KD 方法,在基础到基础 (F2F) 蒸馏中平均提高了 1.9%,在基础到本地 (F2L) 蒸馏中平均提高了 10.6%。

论文五
论文题目:IAFMNet: Information-Aware Feature Modulation for Efficient Super-Resolution
论文作者:徐俊伟,刘孟祖,汪振宇,毋芳芳,吴斯佳,黄韬,董伟生(通讯作者)
作者单位:西安电子科技大学
论文概述:针对轻量化图像超分辨率(SISR)在现实算力受限下难以兼顾性能与效率的问题,本文提出了一种基于信息理论的自适应轻量化超分辨网络IAFMNet。该模型突破了传统轻量化网络采用空间均匀分配计算资源的局限性,从信息理论视角出发,认为图像中分布不均的边缘与纹理区域承载了更关键的重建信息且具有更高的理论编码成本。为此,IAFMNet 引入了新颖的信息密度估计器(IDE),通过在无监督模式下最小化信息熵损失来生成特征级的像素级信息密度图(IDM),从而精准识别高信息量的重建难点区域。在 IDM 的显式引导下,网络构建了由信息引导资源分配(IGRA)支路与仿射再校准模块(ARM)组成的双支路协同架构,其中 IGRA 支路利用子流形稀疏卷积将计算开销集中于关键纹理区域,而ARM支路则通过信息感知的仿射变换实现细粒度的特征软调制。实验结果表明,IAFMNet 在 Urban100 等多个基准数据集上展现了卓越的重建精度与计算效率平衡,其视觉恢复效果在保持较低显存占用的同时显著优于现有最先进的轻量化 SR 方法,充分验证了引入信息密度先验在优化超分辨率网络性能中的有效性。

论文六
论文题目:Fine-grained Image Aesthetic Assessment: Learning Discriminative Scores from Relative Ranks
论文作者:杨智超,王建杰,张之显赫,谢盘古,盛祥非,陈鹏飞,李雷达(通讯作者)
作者单位:西安电子科技大学
论文概述:图像美学评价(Image Aesthetic Assessment, IAA)在内容创作、相册管理和推荐系统等领域具有广泛的应用。在这些应用场景中,通常需要从一系列美学差异细微的相似图序列中挑选出最具美感的图像,我们将其称为细粒度图像美学评估。然而,现有的先进美学评估模型通常针对粗粒度评估设计,即对美学差异显著的图像进行独立的绝对评分,这限制了它们在区分细微美学差异方面的能力。为解决这一问题,我们构建了FGAesthetics,一个包含32,217张图像的细粒度美学评估数据库,这些图像组织成10,028个序列,涵盖了自然图像、AIGC和图像裁剪等多个类别。通过序列内的成对比较进行标注,并设计了序列优化和排序校准策略来确保数据和标注的可靠性。基于FGAesthetics,我们进一步提出了FGAesQ,一个新颖的美学评估框架,通过差异保持分词(Difference-preserved Tokenization, DiffToken)、对比文本辅助对齐(Comparative Text-assisted Alignment, CTAlign)和排序感知回归(Rank-aware Regression, RankReg)从相对排序中学习具有判别性的美学分数。FGAesQ不仅能在细粒度场景下实现准确的美学评估,同时在粗粒度评估中保持竞争力。大量实验和对比结果证明了所提方法的优越性。

论文七
论文题目:Rethinking Knowledge Transfer in Image Quality Assessment: A Perceptual Preference Structure Alignment Perspective
论文作者:李奥博,吴金建(通讯作者),刘永旭,马居坡,董伟生
作者单位:西安电子科技大学
论文概述:随着成像场景迅速多样化,图像质量评价(IQA)面临一项关键挑战:如何将现有标注数据集中的感知知识有效迁移到新场景中,实现可靠的质量预测。然而,现有 IQA 模型的迁移泛化能力普遍不足:直接迁移常导致性能大幅下降,多数据集联合训练也难以带来稳定增益,甚至可能拖累目标域表现。我们认为其根本原因在于不同数据集的感知偏好结构存在差异:模型在不同来源上依赖的感知线索不一致,进而造成条件分布不匹配,从而限制了可迁移性。
为此,我们提出感知偏好表征(PPR),通过分析视觉特征与质量分数之间的相关性,量化数据集特有的感知偏好结构。PPR 可在无需额外训练的情况下评估跨数据集的感知偏好一致性,为迁移可行性分析提供了系统且可解释的工具。在此基础上,我们进一步提出偏好结构对齐迁移(PreSTA),通过迭代筛选与目标域感知偏好更一致的样本来完成迁移。在跨域与域内设置下,PreSTA 仅需少量样本即可显著提升迁移性能;在定向联合迁移场景中,也能仅利用部分联合数据稳定获得更优表现。

论文八
论文题目:From Contrast to Consistency: Rethinking Event-based Continuous-Time Optical Flow Estimation
论文作者:胡睿,吴淞(共同第一作者),杨文,吴金建(通讯作者)
作者单位:西安电子科技大学
论文概述:随着动态视觉感知技术的发展,连续光流估计的核心挑战在于:如何充分利用事件相机微秒级延迟与高动态范围的物理特性,实现对精细时序运动的准确建模。然而,现有模型普遍面临局限:一方面,真实场景中密集连续时间标注的匮乏,制约了监督学习的有效性;另一方面,主流的自监督方法多依赖对比度最大化(CM)框架,侧重于锐化变形事件图像(IWE)。这种追求端点对齐的范式忽略了运动轨迹的时间连续性与结构一致性,导致在复杂或非线性运动场景下,估计轨迹易发生失真与扭曲。
为此,我们提出了时空结构一致性(STSC)准则。将事件视为编码物理运动连续性的时空流形样本,通过联合约束局部结构稳定性与轨迹连续性,确保了运动场跨时间的物理连贯性。基于此,我们构建了一种用于连续光流估计的混合监督框架 STSC-Flow。我们设计了一个双向互补的多尺度网络架构以显著增强特征表征与鲁棒性,并采用课程引导的锚定混合训练策略,使模型能够从有监督的点约束平滑过渡到自监督的流形正则化。在 DSEC-Flow 和 MVSEC 等多个基准数据集上的全面实验表明,本方法在连续时间与标准光流估计任务中均达到了 SOTA性能,能够高保真地恢复出符合真实物理动态的连续运动场。

论文九
论文题目:Scaling Dense Event-Stream Pretraining from Visual Foundation Models
论文作者:陈志文,侯军辉,朱智宇,吴金建(通讯作者),石光明
作者单位:西安电子科技大学
论文概述:随着动态场景与多传感器应用的迅速扩展,事件视觉领域面临一个关键问题:如何在缺乏大规模标注的条件下,实现可泛化、可迁移的高质量表征学习。现有方法在跨数据集与跨任务迁移时往往性能波动明显,联合训练也难以稳定提升。其根本原因在于图像与事件之间在稀疏性与语义结构上的天然错配,导致传统局部对齐蒸馏易出现“语义塌缩”。为此,我们提出ScaleEvent,一种面向大规模事件流的结构感知跨模态的预训练框架。通过构建大规模同步图像–事件数据,并引入视觉基础模型作为教师,我们在更大感受野上进行语义结构级对齐,结合事件激活掩码与结构一致性损失,实现稳定而细粒度的事件表征学习。在语义分割、深度估计与光流等多项任务上,ScaleEvent显著刷新性能上限,并在少样本与线性探测设置下依然保持领先表现,展现出卓越的数据效率与迁移能力。ScaleEvent为事件视觉迈向“基础模型时代”提供了可规模化、可泛化的全新路径。

论文十
论文题目:Balanced Dataset Distillation via Modeling Multiple Visual Pattern Distribution
论文作者:石光辉,梁雪峰,文麒翔
作者单位:西安电子科技大学
论文概述:随着数据规模与模型复杂度的急剧增长,从头训练深度神经网络的计算成本日益高昂。数据集蒸馏(DD)技术应运而生,旨在将大规模数据集压缩为极小规模的精炼数据集,以实现高效的网络训练。然而,现有的核心集选择和基于合成的DD方法依然面临“模式不平衡”这一共同缺陷:它们通常将每个类别的分布视为单一簇,要么过度关注代表高频信息的类通用视觉模式,要么偏向对模型泛化至关重要的稀缺边缘视觉模式。此外,由于合成图像的优化过程会引入特定网络架构的归纳偏置,导致基于合成的方法跨架构泛化能力较弱。这一双重挑战促使我们将目光转向能够天然保持模式平衡的核心集选择范式。为此,我们提出了一种名为平衡模式选择(BPS)的新颖框架。BPS通过探索数据集内在的层次化语义结构,显式地对每个类别内部的多视觉模式分布进行建模。随后,BPS均衡地从每个视觉模式的中心(类通用模式)和边缘(边缘模式)分别抽取互补的子集,从而构建出模式平衡的核心集。在理论上,我们证明了BPS所选核心集在信息覆盖度与模型性能上均与原始数据集实现了有效对齐;同时,其模型无关的特性确保了强大的跨架构泛化能力,而“一次优化适配所有每类图像数量(IPC)”的属性则大幅提升了蒸馏效率。在经验上,在四个基准数据集上的大量实验充分验证了BPS的优越性。

论文十一
论文题目:Dynamic Label Noise Suppression with Optimal Teacher Pool for Facial Expression Recognition
论文作者:杨玉壮,田小林,孙其功
作者单位:西安电子科技大学
论文概述:由于面部表情固有的模糊性及数据集标注的主观性,在带噪声标签条件下进行学习仍然是面部表情识别领域的一项关键挑战。师生网络的监督机制为解决噪声标签的面部表情识别问题提供了一种有前景的途径。然而,该方法在训练过程中易受噪声累积以及师生网络参数逐渐耦合的影响。为此,我们提出了一种最优教师池驱动的动态噪声抑制框架。具体而言,我们构建了一个最优教师池架构,能够动态维护多个最优教师模型并融合其预测结果,进而通过特定的更新机制缓解噪声累积和师生参数耦合问题。此外,我们提出了两个样本层面的噪声抑制方法:(1) 相似性感知标签平滑:不同于传统标签平滑中固定的平滑强度,该方法基于预测与标签的相似性自动调整教师模型的平滑强度,实现细粒度的噪声抑制。(2) 置信度加权对数:基于样本到质心的置信度度量自适应调整学生模型的分类损失,从而减轻噪声样本对模型训练的负面影响。在多个基准数据集上的大量实验表明,我们的方法在不同噪声水平下均优于现有先进方法,验证了所提框架在从含噪声标签数据中学习鲁棒表征方面的有效性。

论文十二
论文题目:Vision-Language Model Guided Source-Free Domain Adaptation via Optimal Transport
论文作者:韩硕,唐旭,马晶晶,张向荣
作者单位:西安电子科技大学
论文概述:无源域适应(Source-Free Domain Adaptation, SFDA)任务旨在仅有预训练模型的前提下在无标注的目标数据上实现跨域迁移学习。当前主流SFDA方法在面对显著领域差异时,其模型鲁棒性与训练稳定性面临严峻挑战,其自训练策略或伪标签监督方法容易引入大量噪声并固化模型固有偏差,最终导致模型在复杂跨域场景下的性能发生退化。为了解决这一难题,本文提出一种全新的SFDA方法(VSFOT)。该方法不再局限于模型自身的监督训练,而是以大规模预训练视觉语言模型作为先验知识引导,结合最优传输理论重构域对齐过程,高效完成跨域知识迁移。该方法一方面,利用视觉语言模型丰富的通用语义先验指导目标域特征与源域原型的软对齐,从源头规避硬标签噪声;另一方面,将任务模型的高置信度预测反馈给视觉语言模型,注入特定任务知识以微调其适应能力。这种语义引导和分布感知的双重驱动路线,将传统监督适应转化为几何感知的语义匹配问题,有效提高SFDA任务在目标领域预测的准确性。四个主流数据集上的实验结果表明,VSFOT 取得了优秀且稳定的结果印证了本文所提方法的有效性。

论文十三
论文题目:Learning Hierarchical Hyperbolic Mixture Model for Part-aware 3D Generation
论文作者:杨麒瞳,冯明涛(通讯作者),武子杰,祝慧鑫,董伟生,王耀南,Ajmal Mian
作者单位:西安电子科技大学,湖南大学,The University of Western Australia
论文概述:三维模型的高效可控生成在具身智能、元宇宙和多媒体领域有着重要作用,目前方法通常忽略了细粒度的部件关系,或者在欧几里得空间中低效地编码多尺度语义。本文提出了一种新的框架,用于在双曲空间中进行层次化和高效的部件级感知生成。采用双曲流形来解决欧几里得嵌入中的“高分辨率拥挤”问题,是树形分层数据建模的一种逻辑新颖的解决方案。提出新的耦合噪声解耦策略,该策略与双曲空间的几何形状相匹配,并使用双曲扩散求解器确保在流形上进行有效采样。大量实验表明,所提出的方法法具有较好的生成质量和效率。

02 ICLR 2026 录用论文
论文一
论文题目:Task-free Adaptive Meta Black-box Optimization
论文作者:王超,焦李成,李玲玲,赵嘉璇,王冠淳,刘芳,杨淑媛
作者单位:西安电子科技大学
论文概述:元黑盒优化通过元学习自动配置黑盒优化器以缓解对于人工启发式的过度依赖。然而,现有方法通常需要大量的手工训练任务来学习能够泛化到目标任务的元策略,这对于任务分布未知的实际应用构成了严重的限制。为了克服这一问题,我们提出了自适应元黑盒优化模型(Adaptive meta Black-box Optimization Model, ABOM)。该模型仅使用来自目标任务的优化数据进行在线参数自适应,无需预定义任务分布。与将元训练和优化阶段解耦的传统元黑盒优化框架不同,ABOM引入了一种闭环自适应参数学习机制,其中参数化的演化算子利用优化过程中生成的种群不断进行自我更新。这种范式转变实现了零样本优化:ABOM在合成元黑盒优化基准测试和实际无人机路径规划问题上均取得了具有竞争力的性能,该过程无需预定义任何训练任务。可视化研究表明,参数化的演化算子表现出显著且规律的搜索模式,包括自然选择和基因重组。

论文二
论文题目:STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
论文作者:张潇文,高志,焦李成,李玲玲,李庆
作者单位:西安电子科技大学,北京通用人工智能研究院
论文概述:在视觉-语言模型(VLMs)中,文本描述与视觉坐标之间的不对齐通常会导致幻觉问题。这个问题在诸如时空视频定位(STVG)这样的密集预测任务中尤为严重。传统的方法通常集中于增强视觉-文本对齐或附加辅助解码器。然而,这些策略不可避免地引入了额外的可训练模块,导致了显著的标注成本和计算开销。为了应对这些挑战,我们提出了一种新的视觉提示范式,避免了跨模态坐标对齐这一难题。具体而言,我们将每帧的坐标预测重新表述为一个紧凑的实例级识别问题,通过为每个物体分配一个唯一且随着时间移动保持一致的标识。这些标识被嵌入到视频中,作为视觉提示,为VLMs提供了明确且可解释的输入。此外,我们还引入了STVG-R1,这是第一个用于STVG的强化学习框架,它采用任务驱动的奖励机制,联合优化时间精度、空间一致性和结构化格式正则化。在六个基准测试上的大量实验表明我们方法的有效性。令人惊讶的是,尽管训练时目标物体的识别编号是唯一的,STVG-R1在多物体指代视频目标分割任务上展现了强大的zero-shot泛化能力,达到了47.3% J&F,刷新了最优成绩。

论文三
论文题目:Learning What Matters Mow:Dynamic Preference Inference under Contextual Shifts
论文作者:曹显伟,权豆,张振亮,王爽
作者单位:西安电子科技大学,北京通用人工智能研究院
论文概述:现实决策情境中,通常需要权衡多个目标,有时这些目标甚至相互冲突,人类往往会根据情况变化调整优先级,而非遵循固定的目标函数。相比之下,现有的决策方法往往假设偏好权重是静态的,或者奖励是已知的标量值。本文研究了偏好权重作为不可观测的潜在变量随情境漂移时的序列决策问题。具体而言,我们提出了动态偏好推断(DPI),这是一个受认知启发的框架,其中智能体维护一个关于偏好权重的概率信念,根据最近的交互更新该信念,并将推断出的偏好作为其策略的条件。我们将DPI实例化为一个变分偏好推断模块,该模块与一个基于偏好的Actor-Critic模型联合训练,并使用向量值回报作为潜在权衡的证据。在排队、迷宫和目标由事件驱动变化的多目标连续控制环境中,DPI 会根据新的机制调整其推断出的偏好,并实现比固定权重和启发式基线更高的转换后性能。

论文四
论文题目:EventFlash: Towards Efficient MLLMs for Event-Based Vision
论文作者:刘少禹,李家宁,赵光辉,张云剑,江文,李明,季向阳
作者单位:西安电子科技大学,清华大学,北京理工大学,光明实验室
论文概述:本文提出了 EventFlash,一种面向事件相机视觉的高效多模态大语言模型(MLLM),旨在解决现有event-based MLLMs在长时序建模和计算效率上的瓶颈。不同于将稀疏事件流转化为致密类图像表示的传统做法,EventFlash从事件数据的时空稀疏性出发,系统性地引入时空 token 稀疏化策略,在显著降低冗余计算的同时保持推理性能。具体而言,本文设计了自适应时间窗口聚合模块以高效压缩时间维token,并提出密度引导的稀疏注意力机制以抑制空间上的低信息区域,从而实现高效的时空建模。此外,作者构建了大规模、场景多样的EventMind 指令数据集,并采用由短到长的课程学习策略以支持长时序事件流理解。实验结果表明,EventFlash 在保持与基线模型相当性能的同时,实现了最高12.4× 的推理吞吐提升,并将可处理的事件时间窗口扩展至 1,000个bins,显著优于现有方法,展示了其作为高效事件视觉基础模型的潜力。

论文五
论文题目:Dual Distillation For Few-shot Anomaly Detection
论文作者:董乐,谭钦中,李春磊,胡敬良,石一磊,董伟生,朱晓香,牟立超
作者单位:西安电子科技大学,脉得智能科技
论文概述:医学影像中的异常检测对临床早期诊断至关重要,但传统无监督方法依赖大量正常样本且难以跨场景泛化。为此,本文提出一种面向小样本异常检测的双蒸馏框架D24FAD,仅需少量正常参考图像训练即可完成新类别中的异常判别。该方法以预训练编码器作为教师网络,提取支撑图像与查询图像的多尺度特征;学生解码器则通过教师-学生蒸馏与学生自蒸馏实现知识迁移与异常判别。此外,提出了可学习权重机制,动态评估各支撑图像相对于当前查询的参考价值,从而优化检测性能。为系统评估,作者收集了一个涵盖四个器官、四种成像模态、五类疾病共13084张图像的基准数据集。大量实验表明,D24FAD在多个任务上显著超越现有方法,且推理速度快、显存占用低,为临床有限样本场景下的异常检测提供了高效可行的新方案。

03 TPAMI 录用论文
论文一
论文题目:Physics-Informed Matrix Factorization Operator
论文作者:吴文铭,田晨曦,焦李成,李玲玲,刘旭,刘芳,马文萍,杨淑媛
作者单位:西安电子科技大学
论文概述:矩阵分解是机器学习中的基础表征模型,通常通过数学分解、重构损失函数进行建模。然而,矩阵分解对数据噪声敏感,结果依赖数据质量。受到物理学的启发,我们将物理定律引入矩阵分解,构建物理信息矩阵分解算子(PiMF)。PiMF 算子利用热传导方程构建矩阵分解的能量目标函数,从而在保留数学分解意义的同时,满足物理学上的可解释性。PiMF 遵循物理定律,从而抑制了违反这些物理规律的不规则或突变的噪声信号,提高了在复杂数据(尤其是噪声数据)上的泛化。本文从理论上证明了构建的能量目标函数与数学模型之间一致性,验证了使用物理机制进行矩阵分解的可行性。此外,从能量下降的角度证明了PiMF算子的物理可解释性。本研究将PiMF应用于经典的模式识别问题:分类和聚类。分别结合分类和聚类任务的先验信息作为约束,构建了PiMF-cla和PiMF-clu模型,扩展了PiMF算子的应用。PiMF-cla和PiMF-clu模型的实验结果展示了所提算子的优势,物理启发矩阵分解建模的重要性得到了验证,尤其是在含噪声数据中。

论文二
论文题目:Like Human Rethinking: Contour Transformer AutoRegression for Referring Remote Sensing Interpretation
论文作者:柴金铭,焦李成,路小强,李玲玲,刘芳,孙龙,刘旭,马文萍,李卫斌
作者单位:西安电子科技大学
论文概述:遥感多模态目标解译在生态保护、资源勘探与应急管理等场景中具有重要应用价值。然而,现有遥感参考表达理解与分割(RRSECS)任务在处理大尺度影像中的微小目标时,仍存在定位漂移问题;同时,轮廓自回归方法具备低计算复杂度和解译拓扑一致性优势,但在迁移至遥感领域时,面临轮廓-边界拟合失准及多任务协同优化冲突挑战。为应对这些挑战,我们让机器效仿“像人类一样重新思考”,模仿人类视觉“先扫视后聚焦”等六大生物机制,提出全新遥感自回归范式——SeeFormer,旨在提升遥感影像中微小目标与复杂形状目标的解译能力。为实现这一点,我们模拟“人脑视觉语言双通路”思想,提出Coarse-to-Fine两阶段多模态目标感知策略:Coarse阶段定位目标大致位置并提取有效特征,Fine阶段进一步感知目标轮廓与纹理细节;同时人类语言信息在双阶段感知过程中起到关键先验和方向性定位引导作用。此外,设计基于拐点的轮廓采样器以提升Mask-to-Polygon重建保真度,提出自回归双解码器范式以在保持序列一致性的同时缓解多任务优化冲突。在覆盖不同场景、尺度和任务范式的多个数据集上的大量实验表明,所提出的SeeFormer 有效解决了上述挑战,并在遥感RIS和VG任务上均展现出显著的性能优势。

据悉,CVPR是计算机视觉和模式识别领域顶级学术会议之一。本届会议共有16,092篇论文进入评审流程,最终4,090篇被接收,录取率为25.42%。
ICLR是人工智能与机器学习领域的顶级会议,与 NeurIPS、ICML 并称为机器学习领域三大顶会。本届会议共收到有效投稿约19,000篇,最终录用论文约5,350篇,录用率为28.18%。
TPAMI是人工智能领域最具影响力的学术期刊之一,在中国计算机学会(CCF)期刊会议推荐列表中为A类,是中科院一区TOP期刊, 最新影响因子为18.6。