实验室ICML、ACL 2026论文简介

作者:时间:2026-05-12点击数:

近日,国际机器学习会议(International Conference on Machine Learning,简称ICML)、国际计算语言学年会(Annual Meeting of the Association for Computational Linguistics,简称ACL)确认录用结果,实验室7篇论文被ICML 2026录用,2篇论文被ACL 2026录用

ICML 2026录用论文中,第一作者分别是贺晶博士生(导师:焦李成教授),王佳豪博士生(导师:刘芳教授),樊志诚博士生(导师:侯彪教授),孙琦博士生(导师:侯彪教授,联合指导老师:曹震副教授),莫世冰博士生(导师:刘静教授),梁嘉铭硕士生(导师:王晗丁教授),韩牧岐硕士生与邢若琦本科生(共同一作,导师:吴凯副教授)。ACL 2026录用论文中,第一作者分别是唐世林硕士生(导师:梁雪峰教授),李玉辰博士生(导师:王晗丁教授)。论文简要介绍如下:



ICML 2026 录用论文

论文一

论文题目:DSGCR: Decomposed Spectral Geometry-Aware Cross-Modal Semantic Representation for 3D Visual Grounding

论文作者:贺晶,焦李成,李玲玲,路小强,刘旭,马文萍,刘芳,孙龙

作者单位:西安电子科技大学

论文概述:3D视觉定位旨在根据自然语言描述在三维场景中定位或分割目标物体,是具身智能、机器人感知和三维场景理解中的关键任务。然而,现有方法在跨模态表示学习方面仍面临两方面挑战。一方面,大多数方法依赖单模态预训练编码器分别提取视觉和语言特征,导致视觉特征难以充分感知文本语义,进而产生跨模态对齐不足。另一方面,现有空间关系建模通常依赖欧氏距离角度等手工几何先验,在深度网络低频偏置的影响下,难以捕获细粒度、高频和方向敏感的空间关系,限制了复杂三维场景中的精确推理能力。为应对这些问题,我们提出了分解谱几何感知的跨模态语义表示方法DSGCR,该方法从语义对齐和几何建模两个角度增强三维视觉定位表示。具体而言,设计了文本感知特征调优模块TFT,将语言上下文注入视觉层级特征中,通过动态门控机制突出与文本相关的视觉区域,缓解预训练视觉特征与3DVG任务之间的语义偏移。进一步,我们提出分解谱几何模块DSG,引入可学习的傅里叶频率,将点云空间关系映射到谱域,并显式分解为对称分量和反对称分量,分别建模距离相关关系和方向敏感关系,以更好地捕获复杂空间描述。通过TFT与DSG的协同作用,DSGCR能够同时提升细粒度跨模态语义对齐和复杂几何关系建模能力。在ScanRefer、Nr3D和Sr3D等多个三维视觉定位基准上的实验表明,该方法在3DREC和3DRES任务中均取得了优异性能,验证了其在复杂三维场景理解中的有效性和泛化能力。


论文二

论文题目:Foreground-Aware Token Routing Vision Transformer for Real-Time Satellite Video Tracking

论文作者:王佳豪,刘芳,焦李成,李硕,王浩,李玲玲,黄欣研,刘旭

作者单位:西安电子科技大学

论文概述:实时卫星视频目标跟踪需要在高空间-时间分辨率、动态复杂背景以及星载计算资源受限等条件下实现快速而准确的目标定位。现有基于判别相关滤波的方法虽然推理速度较快,但特征表达能力有限,难以在复杂背景和小目标场景下保持较高跟踪精度;而基于视觉Transformer的方法虽然能够通过统一的特征表示与聚合机制获得更强性能,但其计算开销较大,难以满足实时卫星视频跟踪的实际部署需求。如何在跟踪精度与推理效率之间取得平衡,是卫星视频目标跟踪领域亟待解决的问题。为应对这些挑战,我们提出了一种前景感知的Token路由视觉Transformer框架,称为FATrack。该方法的核心是轻量化的FA-ViT骨干网络,通过前景感知Token路由机制,将计算资源集中分配到与目标相关的前景区域,同时抑制背景区域中的冗余计算,从而提升跟踪效率与判别能力。进一步地,为缓解Token稀疏化过程中带来的语义退化问题,设计了自适应散射模块ASM,通过空间-通道联合注意力和稀疏结构传播,对关键前景Token进行选择性增强,并将有效语义信息传播到扩展后的空间表示中,从而保持目标结构连续性和特征语义一致性。通过FA-ViT与ASM的协同设计,FATrack在保持实时推理速度的同时显著提升了卫星视频跟踪精度。在多个卫星视频跟踪基准数据集上的大量实验表明,该方法在精度和速度方面均优于现有实时跟踪器,并取得了与传统轻量方法相当的推理效率,展现出在大规模遥感视频智能分析和星载实时跟踪任务中的应用潜力。


论文三

论文题目:De4D-SLAM Gradient-Isolated Static-Dynamic Decoupling for Monocular SLAM in Dynamic Environments

论文作者:樊志诚,邬子同,樊肇星,张潇,侯彪,任博

作者单位:西安电子科技大学

论文概述:面向动态环境的传统单目SLAM方法通常将动态物体视为异常值剔除,这会在地图中抹除真实的动态障碍物,造成危险的感知盲区,进而限制具身智能体的全面环境感知。尽管将高斯泼溅(3DGS)技术集成到SLAM中有助于实现整体的场景表示,但在动态场景下直接应用往往会产生严重的重影伪影。而试图引入动态高斯基元进行无监督重建时,由于缺乏明确的类别先验,又会引发“优化悖论”。由于4D动态高斯基元具有极高的灵活性,它们在朴素的联合优化过程中会迅速对静态背景残差产生过拟合。这一现象削弱了区分运动状态所必需的自监督误差信号,进而导致掩码崩溃。为应对这些挑战,我们提出了De4D-SLAM,这是一个单目动静解耦的4D重建双流框架。为了实现这一点,我们构建了一种梯度隔离解耦策略,利用静态重建残差来监督空间感知Kolmogorov-Arnold网络(SA-KAN),从而确保鲁棒的、与类别无关的运动分割。此外,为克服新激活动态高斯基元在冷启动时的收敛难题,我们设计了一个光流引导初始化机制,利用稠密光流为4D高斯基元的非凸优化过程提供先验并使其稳定。在TUM和Bonn数据集上进行的大量实验表明,De4D-SLAM在跟踪精度和动态场景重建保真度方面均实现了最先进的性能,成功化解了稳健定位与高保真4D建图之间的矛盾。


论文四

论文题目:Narrowing the ANN–SNN Gap for 1D Signal Classification with Multi-Scale Temporal Encoding and Sparsity-Regularized Transform Encoding

论文作者:孙琦,黄煜垒,曹震,侯彪

作者单位:西安电子科技大学

论文概述:脉冲神经网络(SNNs)有实现高能效推理的潜能,但在静态视觉基准测试中,短模拟时长下SNN效果通常落后于与之对应的ANNs。在匹配的计算预算下,这种ANN-SNN在具有代表性的1D信号分类基准上的准确率差距,往往比在图像基准上要小得多。我们将此归因于机制层面的不匹配:具体来说,对于原生的时间信号,漏电积分(leaky integration)实现了随时间推移的因果证据累积;而静态图像通常需要将幅度转换为脉冲,其有限窗口的估计误差在短时距下影响很大。考虑到这个方面,我们提出了一个结合多尺度时间编码(MTE)和稀疏正则化变换编码(STE)的框架。MTE用多尺度流替代了简单的重复,并分配与尺度对齐的多比特整数脉冲,以提高每步的信息密度。STE用经过辅助重建和稀疏正则化训练的变换编码器神经元,替代了一定比例的LIF(leaky integrate-and-fire)单元,其中合成分支仅在训练期间使用。我们在多种信号识别数据集上与多个骨干网络进行了对比,结果显示MTE×STE始终优于标准的SNN基线,在准确率-效率的权衡上取得了提升,并且达到或偶尔超过了对应的ANNs水平。


论文五

论文题目:Order Matters: Unveiling the Hidden Impact of Macro Placement Sequences via Proxy-Guided LLM Evolution

论文作者:莫世冰,刘静,徐建楚,吴瑞霖

作者单位:西安电子科技大学

论文概述:宏单元布局是现代芯片物理设计中的关键环节,其质量直接影响芯片的线长、性能与可制造性。现有机器学习布局方法大多关注“宏单元应该放在哪里”,却常常将“哪些宏单元应该先放”视为固定启发式或随机先验。本文指出,布局顺序并非简单的预处理步骤,而是影响优化结果的关键维度:早期不佳的布局决策可能引发不可逆的“多米诺效应”,持续压缩后续搜索空间并导致较差局部最优。为此,本文提出 OrderPlace,一个基于代理评估与大语言模型演化的宏单元布局顺序自动发现框架。OrderPlace 利用设计的轻量级代理任务高效筛选候选排序策略,并借助大语言模型演化出可泛化的代码级排序规则,包括静态指标排序与动态物理启发机制。实验结果表明,在标准 ISPD 2005 基准测试上,OrderPlace 能够发现新颖且有效的布局顺序策略,相较于 WireMask-EA 和当前先进方法 EGPlace,分别降低线长 34.04% 和 14.08%,展现了布局顺序优化在电子设计自动化中的巨大潜力。


论文六

论文题目:Multilingual Safety Alignment Via Sparse Weight Editing

论文作者:梁嘉铭,王兆鑫,王晗丁

作者单位:西安电子科技大学

论文概述:大语言模型在英语等高资源语言中通常比较安全,但在低资源语言中如印尼语等更容易被越狱攻击绕过。现有多语言安全对齐方法依赖SFT、RLHF或翻译桥接等成本高方法,并且受限于多语言安全数据和翻译误差。本文提出一种无需训练的多语言安全对齐方法(Sparse Weight Editing)。其核心思想是模型安全能力集中在少量安全神经元上,因此只需编辑这些神经元的权重,将低资源语言的有害表示对齐到英语安全子空间。为避免破坏模型通用能力,该方法引入无害样本构造零空间约束并加入低秩约束,最终得到一个可闭式求解的轻量更新方法。实验覆盖8种语言和Llama-3.2、Qwen2、Qwen2.5等多个模型。结果表明,该方法能稳定降低低资源语言中的攻击成功率,并且对MGSM、M-MMLU等通用能力影响较小。同时,该方法可以与MPO等已有安全对齐方法叠加,进一步提升安全性。


论文七

论文题目:MetaDistill: Unlocking the Performance Ceiling for Pretrained Optimizers

论文作者:韩牧岐,邢若琦(共同一作),吴凯,张肖瑜,王晗丁,王子龙

作者单位:西安电子科技大学

论文概述:元黑盒优化(Meta Black-Box Optimization, MetaBBO)近年来成为一种有前景的优化范式,其核心思想是利用元学习自动调控底层黑盒优化器的配置。然而,当面对未见过且复杂的目标函数景观时,现有 MetaBBO 方法的泛化能力仍受到显著限制。我们指出,这一限制主要源于当前训练机制所带来的性能上界瓶颈:现有方法通常以自监督或无监督方式从头训练元优化器,使其无法接触到先进且高质量的优化行为,从而倾向于收敛到次优优化策略。

为此,本文提出 MetaDistill,一个通用的 MetaBBO 训练框架,旨在通过预训练与测试时微调提升可学习优化器的策略上限。在预训练阶段,将经典进化算法的高质量优化策略建模为专家优化轨迹,并利用这些轨迹进行知识蒸馏,使可学习优化器能够习得更先进的优化行为。在可选的测试时微调阶段,进一步采用自监督微调作为热启动,以在未见任务上细化通过蒸馏习得的优化知识。本文在 BBOB benchmark和三个控制任务上对 MetaDistill 进行了评估。实验结果表明,相较于原始训练范式,MetaDistill 能够显著提升多种可学习优化器的泛化能力。


ACL 录用论文

论文一

论文题目:TRACE: Two-Phase RL for Causal Graph Exploration and Deeper Psychological Intervention in Dynamic Counseling Scenarios

论文作者:唐世林,殷尊轶,梁雪峰,石光辉,童松,陈广钰

作者单位:西安电子科技大学,北京师范大学,Tohoku University

论文概述:面对全球心理健康问题高发与专业咨询资源短缺的双重挑战,大语言模型为AI心理咨询提供了新机遇。然而,现有模型(如SoulChat、SMILE及SoulChat 2.0等)普遍依赖数据驱动的训练范式,主要学习用户输入与回复间的关联映射。这使得模型虽擅长提供即时情绪缓解与反应性共情,却难以主动系统地探究心理困扰的核心成因,难以对用户产生深远持久的积极改变。在真实咨询实践中,有效的心理干预有赖于对用户问题背后心理维持机制的深入整合与理解,这正是临床心理学中“案例概念化”的核心。受此启发,本研究创新性地引入因果图来结构化实现“案例概念化”,并提出强化学习框架TRACE使得模型学会先主动探索以完成案例概念化,再进行更具针对性的干预。实验结果表明,TRACE在因果图重构效果及干预有效性等核心指标上均取得显著改进,验证了将临床心理学理论引入AI心理咨询决策过程的有效性。有别于先前直接依赖完备静态用户画像构建因果图的做法,TRACE模拟了信息逐步披露的真实场景中,咨询师通过多轮交互逐步完成案例概念化的过程。


论文二

论文题目:Solver-Independent Automated Problem Formulation via LLMs for High-Cost Simulation-Driven Design

论文作者:李玉辰,王晗丁,薛冰,张孟杰,金耀初

作者单位:西安电子科技大学,惠灵顿维多利亚大学,西湖大学

论文概述:在高开销仿真驱动设计领域,将模糊的设计需求转化为数学优化问题形式,是提升产品性能优化效率的一大瓶颈。该过程耗时长,并且高度依赖专家知识。尽管大语言模型为自动化完成这一任务提供了潜力,但现有方法存在形式化能力不足、难以准确对齐设计意图的问题,或者依赖求解器反馈进行数据筛选,而在高开销仿真场景下这类反馈往往难以获得。为应对这一挑战,本文提出了自动问题建模方法(Automated Problem Formulation, APF),这是一种与求解器无关的框架,利用大语言模型将工程师的自然语言需求转化为可执行的优化问题模型。该框架的核心是一套创新的高质量数据自动生成流程,通过数据生成与测试实例标注,在缺少高成本求解器反馈的情况下,解决了构建高质量微调数据集的难题。随后,生成的高质量数据集被用于对大语言模型进行监督微调,从而显著提升其生成准确、可执行优化问题形式化表达的能力。在天线设计任务上的实验结果表明,APF在需求形式化准确性以及所得辐射效率曲线满足设计目标的质量方面,均显著优于现有方法。


据悉,ICML是机器学习领域历史最悠久、规模最大、影响最广的顶级学术会议之一,与NeurIPS、ICLR并称为机器学习三大顶级会议,也是中国计算机学会(CCF)推荐的A类会议。本届会议共收到23918份有效投稿,最终录用6352篇,录用率26.6%。

ACL是自然语言处理与计算语言学领域的顶级国际会议。本届会议共收到12148篇投稿,经过多轮审稿,仅19%论文被接受为Main Conference论文,18%论文被接受为Findings论文。

西安电子科技大学 智能感知与图像理解教育部重点实验室   版权所有   技术支持:西安聚力