计算机视觉与模式识别会议(Computer Vision and Pattern Recognition,CVPR)是在人工智能与计算机视觉领域最具影响的国际顶会之一。2026年CVPR于6月3日至7日在美国科罗拉多州丹佛市举行。大会汇聚了来自全球顶尖高校、科研机构及科技企业的研究人员,是展示计算机视觉、人工智能、多模态学习等领域最新研究成果的重要国际平台。大会同期举办的各项国际竞赛吸引了全球众多优秀团队参与,在相关领域具有广泛影响力。西安电子科技大学人工智能学院参赛队伍在欧洲科学院院士焦李成教授、刘芳教授、马文萍教授、杨淑媛教授、李玲玲副教授、刘旭副教授、陈璞花副教授、李硕博士、杨育婷博士、孙龙博士、马梦茹博士、路小强博士以及团队博士生张柯欣、柴金铭、郝佳瑶、马芹、张京、谢兴霖、贺晶、王一晴等人的共同指导下,在 CVPR 2026 各项国际竞赛中累计斩获31项冠亚季军奖(10冠14亚7季)。团队围绕多模态理解与推理、视频行为分析与交互建模、图像复原与增强、三维与空间感知建模、医学与视觉场景理解、开放世界视觉学习以及视觉生成与编辑等重要研究方向,提出了一系列具有创新性的解决方案。所有获奖队伍均收到竞赛主办方邀请,在大会相关研讨会与挑战赛展示环节中对获奖方法进行了汇报与展示,充分体现了团队在国际计算机视觉竞赛中扎实的研究实力与持续创新能力。本次竞赛所有参赛队伍由国家自然科学基金重点、联合项目,教育部创新团队,国家学科创新引智基地等项目支持。同时,实验室共有13篇论文被CVPR 2026录用(详细名单列于文末)。
CVPR 2026
竞赛一
“CVPR 2026 生物自动标注挑战”聚焦于生态与生物研究场景中的自动化物种标注任务,旨在评估模型在少样本条件下对细粒度生物物种的识别能力。要求模型依据专家式标注指南、物种名称、类别描述以及每类仅 16 张标注样本,对测试图像进行物种级别分类,最终以多个数据集上的平均 Top-1 Accuracy 作为排名指标。该赛题使用 Semi-Aves、Insecta、Weeds、Mollusca、FungiTastic、Plankton、Insects2、PlantDoc 和 RareSpecies 共 9 个数据集。该竞赛由澳门大学,浙江大学,卡内基梅隆大学等机构联合主办。由2025级硕士研究生“任苡雯、刘佳宁、王英鑫”和孙龙博士组成的学生队伍获得该赛题冠军奖项。

(任苡雯、刘佳宁、王英鑫、孙龙)
冠军方案:队伍提出了一种融合生物基础模型与少样本学习机制的自动化物种标注框架。该方案利用生物领域预训练模型提取物种视觉特征,并结合少量标注样本构建物种特征库,实现对细粒度物种的高效识别与精准分类。针对标注样本有限、物种间差异细微以及跨类群泛化能力不足等挑战,团队设计了特征缓存增强机制,显著提升了模型的识别准确率和适应能力。该方案有效降低了生态与生物研究中的物种标注成本,为生物多样性监测和生态环境保护提供了智能化技术支撑。
竞赛二
“CVPR 2026 城堡挑战赛”聚焦长时序第一视角视频问答任务,要求参赛者在超过600小时、多视角、多模态视频数据中,综合利用视频内容、语音信息、场景环境及时间线索,对自然语言问题进行推理并完成答案选择。赛事数据涵盖第一视角与固定视角视频,以及IMU、GPS、生理传感等多源信息,对模型的跨模态理解、长时序记忆与复杂推理能力提出了极高要求。该挑战赛由CASTLE Challenge组织团队主办,由都柏林城市大学Luca Rossetto教授牵头组织。由2025级硕士研究生“李正阳、杜政霖、文怡”和李硕博士组成的队伍获得该赛题冠军。

(李正阳、杜政霖、文怡、李硕)
冠军方案:针对长时间第一视角视频问答中证据分散、跨视角信息关联复杂以及关键片段难以定位等挑战,队伍提出了一种基于Qwen3的证据增强多模态推理方案。该方法通过融合视频、语音、图像等多源信息,自动检索与问题相关的关键证据,并结合不同问题类型开展针对性推理。与此同时,团队采用参数高效微调与多策略协同推断机制,进一步提升模型的场景适应能力和推理准确性,最终实现复杂长时序场景下的高效问答。该方案有效突破了模型在长时间、多视角、复杂场景下的证据定位和答案判断能力,为第一视角长视频理解任务提供了稳定可靠的技术路径。
竞赛三
“CVPR 2026 URVIS 挑战赛:MUSES-AXPS—极限全景分割”聚焦于极端恶劣条件下的全景分割,为自动驾驶等具身智能应用,开发能够抵御雨、雪、雾、夜间、眩光等极端恶劣条件干扰的鲁棒视觉感知系统。赛事采用集成多传感器、含2500张2D全景分割标注的MUSES数据集,通过两阶段标注捕捉类别与实例层面的不确定性,定义了“不确定性感知全景分割”任务。挑战鼓励探索多模态学习和不确定性感知等开创性技术在复杂恶劣环境下的应用。该竞赛由维尔茨堡大学教授Radu.Timofte和苏黎世联邦理工学院讲师Christos Sakaridisc等人联合主办。由2025级硕士研究生“王嘉慧、曹宇思、陈玉英”和杨育婷博士组成的学生队伍获得该赛题冠军。

(王嘉慧、曹宇思、陈玉英、杨育婷)
冠军方案:队伍提出了一种精简融合层级与混合精度推理方案。该方案以CAFuser为基础模型,以更高效的Swin-T为骨干,通过语言-视觉对比损失将条件标记与语义环境描述对齐,并利用条件标记自适应地调整不同传感器模态的融合权重,并通过精简融合层级实现模型轻量化,利用混合精度实现效率与性能的平衡。该方案在雨、雪、雾、夜间、眩光等极端恶劣条件下,提升了感知系统的鲁棒性和准确性。
竞赛四
“CVPR 2026 EPIC-SOUNDS 基于音频的交互检测挑战” 聚焦纯音频信号驱动的细粒度交互行为检测任务,要求模型在长时序第一视角视频中精准定位交互事件发生时间并识别其类别。该任务面向日常厨房场景中的密集交互行为,对模型的音频理解与时序定位能力提出了较高要求。比赛采用EPIC-SOUNDS数据集,该数据集基于EPIC-KITCHENS-100构建,包含约100小时的第一人称厨房视频。标注聚焦于“可听”的交互事件,共定义44个细粒度音频类别。该竞赛由布里斯托大学和卡塔尼亚大学的计算机视觉研究团队联合主办。由2025级硕士研究生“赵振宇、翟子涵、李婷婷”和马梦茹博士组成的队伍获得该赛题冠军奖项;由2025级硕士研究生“任苡雯、唐颖、王英鑫、刘佳宁”和博士研究生“马芹”组成的学生队伍获得该赛题亚军奖项。

(赵振宇、翟子涵、李婷婷、马梦茹)
冠军方案:队伍提出音频密集特征提取与多尺度时序建模相结合的技术路径,利用预训练的音频特征提取网络获取输入音频的密集特征表示,通过特征投影模块与多尺度时序金字塔结构,实现对不同时长交互事件的多层次表征,最终采用密集候选预测头完成44类交互事件的联合分类与边界回归,并通过多尺度回归范围设计提升对变长事件的适应能力。该方案通过因果时序建模机制有效捕捉音频信号中的长时序上下文依赖关系,充分挖掘交互事件之间的时序关联,从而显著提升了在密集交互场景下的定位精度与候选召回能力。
竞赛五
“CVPR 2026 多模态心智理论挑战赛赛道一” 聚焦单智能体推理任务,要求模型结合视频与文本信息,理解智能体对环境状态的隐含信念和行为意图,并完成复杂场景下的决策推理。该任务重点考察模型在不完全观测条件下的信念追踪、状态更新和多模态推理能力,是衡量人工智能高级认知与理解能力的重要挑战。该竞赛由 CVPR 2026 ReLearn 研讨会主办。由2025级硕士研究生“刘佳宁、王英鑫、任苡雯”和路小强博士组成的队伍获得该赛题冠军奖项;由2025级硕士研究生“李正阳、杜政霖、文怡”和博士研究生“张京”组成的学生队伍获得该赛题季军奖项。

(刘佳宁、王英鑫、任苡雯、路小强)
冠军方案:针对单智能体心智理论推理任务中隐状态追踪困难和长时序信息易遗忘等问题,队伍提出了一种融合符号推理与大语言模型的分层混合推理方案。该方法通过显式追踪环境状态和关键行为证据,实现对智能体潜在信念与行为意图的精准推断;同时结合大语言模型增强复杂场景下的语义理解能力。此方案通过显式的状态追踪保留了极高的可解释性,同时利用神经符号系统弥补了纯符号推理在语义理解上的不足,有效解决了纯大模型在长上下文追踪中的状态遗忘与信念误判问题。该方案兼顾了推理过程的可解释性、准确性与运行效率,有效提升了复杂多模态场景中的认知推理能力。
竞赛六
“CVPR 2026 多模态心智理论挑战赛赛道二” 聚焦于多模态心智理论推理任务,要求参赛队伍根据视频观察、场景描述、人物对话和候选答案,推断智能体隐藏的信念、意图、社会目标以及对他人行为目标的理解。该赛题强调模型对多模态信息的综合理解能力,不仅需要识别人物动作和物体状态,还需要结合时序行为、语言表达和交互关系,完成对人物心理状态的深层推理。由2025级硕士研究生“罗蒲、许琮、李玉梅”和博士研究生“张柯欣”组成的学生队伍获得该赛道冠军奖项;由2025级硕士研究生“刘佳宁、王英鑫、任苡雯”和博士研究生“谢兴霖”组成的学生队伍获得同赛道并列第一。

(罗蒲、许琮、李玉梅、张柯欣)
冠军方案:参赛队伍提出了“基于证据引导的多模态心智理论推理”框架。该方案并非直接利用大模型对选项进行判断,而是将问题分解为智能体、目标物体、动作轨迹、对话证据、候选信念及社会目标等结构化信息。在证据建模阶段,系统从视频、场景文本和人物对话中提取关键行为与交互线索,并构建时序化证据链。在推理阶段,利用Qwen3.5-27B模型对候选答案进行语义解析,将其转化为候选心理状态假设,并筛选与问题最相关的动作、物体和对话证据。随后从语言一致性、行为一致性和社会目标一致性等多个维度对候选答案进行综合评分,并结合先验证据进行辅助校准。该方案通过结构化证据建模、相关证据筛选和一致性推理,有效提升了复杂多模态交互场景下的心理状态理解与推理能力。该方案通过结构化证据抽取、候选状态建模、相关证据筛选和一致性评分,有效提升了多模态复杂交互场景下的心理状态推理能力。
竞赛七
“CVPR 2026 Roboflow-20VL少样本目标检测挑战赛赛道2” 聚焦于小样本目标检测任务,要求参赛队伍在仅有少量标注样本的条件下,完成跨场景、跨类别、跨尺度目标的精准定位与识别。赛事涵盖文档版面、工业缺陷、医学影像、商品货架、航拍场景、水表读数、烟雾检测等多种复杂视觉场景,重点考察模型在上下文提示条件下的开放场景泛化能力。参赛方法需在不进行模型微调和参数更新的前提下,仅依靠少量示例、类别描述与推理阶段策略完成高质量检测。由2025级硕士研究生“罗蒲、许琮、李玉梅”和杨育婷博士组成的队伍获得该赛道冠军。
冠军方案:参赛队伍提出了“基于提示词校准的基础模型融合”小样本目标检测框架。该方案以多模态大模型为核心,通过提示词设计将目标检测任务转化为小样本视觉推理任务。在模型层面,融合Qwen-VL、Doubao视觉模型、Gemini以及SAM3等基础模型的语义理解与目标定位能力,实现多模型协同检测;在数据处理层面,针对小目标、低分辨率和低对比度等复杂场景,引入图像增强与区域优化策略,提高检测稳定性。最终通过置信度校准、多模型结果融合和几何规则约束,获得更加准确可靠的检测结果。该方案在无需训练的条件下,有效提升了少样本开放场景目标检测的精度与鲁棒性。
竞赛八
“CVPR 2026 EPIC-SOUNDS 基于音频的交互识别挑战” 聚焦于日常厨房场景中的音频交互理解,对已裁剪好的音频片段进行 44 类交互识别。该赛题使用 EPIC-SOUNDS 数据集,以Top-1准确率为核心评估指标,旨在评估模型在背景噪声复杂、音频片段较短、类别间声学特征相似以及交互样本不足等条件下的识别能力。该竞赛由布里斯托大学和卡塔尼亚大学的计算机视觉研究团队联合主办。由2025级硕士研究生“任苡雯、王英鑫、刘佳宁、唐颖”和博士研究生“郝佳瑶”组成的学生队伍获得该赛题冠军奖项;由2025级硕士研究生“翟子涵、赵振宇、李婷婷”和博士研究生“贺晶”组成的学生队伍获得该赛题亚军奖项。
冠军方案:队伍提出了一种基于音频的多分支概率集成识别框架,采用 Base Spectrogram Ensemble、Context-Aware PaSST 和 AudioInceptionNeXt 三类互补分支共同建模。Context-Aware PaSST 采用 AudioSet 预训练的 PaSST 音频 Transformer,将音频重采样后通过 10 秒输入窗口、1.25s 与 2.0s 时间上下文分支平均融合强化对上下文声学线索的利用;AudioInceptionNeXt 引入卷积音频分类器的不同归纳偏置。最终方案对三类分支进行加权融合。此方案通过PaSST 上下文融合和互补架构集成,有效解决了复杂场景下稀有交互类别识别不足和模型融合鲁棒性不强的问题,显著提升了模型在音频交互识别任务中的准确性、稳定性。
竞赛九
“CVPR 2026 doScenes自动驾驶指令理解挑战赛-历史轨迹与语言赛道”聚焦于自动驾驶场景中的语言引导轨迹预测任务,旨在利用车辆历史运动信息与自然语言驾驶指令预测未来行驶轨迹。赛事基于 doScenes 数据集开展,该数据集在自动驾驶数据集 nuScenes 基础上构建,涵盖 1000 个真实驾驶场景,并进一步引入了近4000条自然语言驾驶指令与场景目标指代标注,实现了语言信息与车辆运动行为的精准关联。挑战鼓励探索自然语言理解与自动驾驶决策规划的深度融合。该竞赛由美国 Machine Intelligence and Interaction Lab研究团队组织。2025级硕士研究生“杜政霖、李正阳、文怡”和博士研究生“柴金铭”组成的学生队伍获得该赛题冠军。

(杜政霖、李正阳、文怡、柴金铭)
冠军方案:围绕自动驾驶场景中的语言引导轨迹预测任务,队伍提出了一种融合历史运动信息与自然语言指令的轻量化预测方案。该方法结合车辆历史轨迹特征与驾驶意图信息,对未来运动轨迹进行精准预测,并通过模型融合策略进一步提升预测性能。实验结果表明,所提出方案相较于传统基线模型将预测误差降低约27.9%,显著提升了自动驾驶场景下的轨迹预测精度。该方案充分发挥了语言与运动信息协同建模的优势,为自动驾驶决策规划研究提供了新的解决思路。
竞赛十
“CVPR 2025 Ego-Exo4D程序理解挑战赛”聚焦于多视角第一人称视频程序多任务理解任务,要求参赛者依托历史视频画面上下文,同步完成前置条件、后续步骤、可选步骤、程序错误、缺失步骤五大类联合预测,以此解决步骤逻辑结构化推理与画面视觉语义二分类异构建模冲突、多任务优化目标矛盾的问题。该竞赛由CVPR 2026 EgoVis Workshop组委会联合Ego4D研究联盟(Ego4D Consortium)主办,依托Meta FAIR(Fundamental AI Research)、Project Aria及全球多所高校共同建设的Ego4D/EgoExo4D数据平台开展。由2025级硕士研究生“翟子涵、李婷婷、赵振宇”和博士研究生“贺晶”组成的学生队伍获得该赛题的亚军奖项。
亚军方案:针对挑战赛多任务异构联合建模的任务需求,队伍提出一种基于分任务头差异化设计的混合融合架构方案,该方案先以图推理模型完成前置/后续/缺失步骤三类结构化任务预测,依托Omnivore预训练骨干提取细粒度视频视觉特征,单独实现可选步骤、程序错误二分类语义判别;再通过伪步骤序列平滑、跨时序不一致修正优化图分支输出精度,借助秩加权融合算法抹平两类模型分值分布偏差,摒弃传统全局平均融合方案。此方案突破了单一模型无法同时适配结构化逻辑推理与视觉二分类的技术瓶颈,在官方测试集平均cAP达0.6544,较官方图基线提升5.4%、纯端到端基线提升11.3%,为同类多任务分治融合提供成熟落地范式。
竞赛十一
CVPR 2026 EPIC-KITCHENS-100动作检测挑战”面向第一人称视角视频理解,要求模型在未剪辑的长视频中同时完成时序动作定位与类别识别,即预测动作片段的起止时间并输出对应的动词-名词组合标签。赛题数据集基于EPIC-KITCHENS,涵盖厨房场景下的第一人称操作视频,具有时序跨度长、动作密集、类别细粒度及分布不均衡等特点,评估指标为动作级别的平均精度均值(Action Avg. mAP)。由2025级硕士研究生“李婷婷、赵振宇、翟子涵”和博士研究生“谢兴霖”组成的学生队伍获得该赛题的亚军奖项。
亚军方案:队伍基于OpenTAD框架构建了一套多分支动作检测系统,采用动词与名词解耦建模策略,分别学习动作类别中的行为与目标信息,并在推理阶段进行联合融合,实现动作级检测。方案融合ActionFormer与CausalTAD两类时序检测框架,兼顾局部动作定位精度与长时序上下文建模能力;同时结合SlowFast和VideoMAE-L等多源视觉特征,通过多尺度时序特征建模提升对不同持续时间动作的识别与检测效果。该方案突破了第一人称视角视频中动作边界模糊、动词-名词组合类别空间爆炸以及细粒度语义一致性难以保证等核心技术瓶颈,验证了多模型互补融合与分支解耦策略在细粒度时序动作检测任务中的有效性。
竞赛十二
“CVPR 2026 EPIC-KITCHENS-100多实例检索挑战”要求模型在视频片段与自然语言描述之间执行双向跨模态检索。与传统视频-文本检索任务不同,该赛题基于动词与名词语义相似度构建软标签相关性矩阵,为每对视频-文本样本赋予连续相关性分数而非二值标签,对模型的细粒度动作理解能力和损失函数设计提出了更高要求。评估指标采用mAP与nDCG,分别衡量精确相关性排序质量与语义梯度排序质量。由2025级硕士研究生“李婷婷、翟子涵、赵振宇”和博士研究生“王一晴”组成的参赛队伍获得该赛题的亚军奖项。
亚军方案:队伍提出了一种名为BiCRA-AVION的视频—文本双向跨模态检索方法。该方法以AVION双编码器框架为基础,在共享嵌入空间映射前引入轻量级双向跨模态注意力模块,实现视频与文本信息的双向交互与协同增强。其中,视频分支利用文本信息引导视觉特征聚合,文本分支则借助视觉信息优化语义表达,从而提升跨模态特征对齐能力。训练阶段采用对称多相似度损失(SMS-Loss)进行双向排序关系建模,推理阶段结合多尺度与水平翻转测试时增强策略,进一步提升检索结果的准确性与鲁棒性。该方案突破了传统双编码器框架中独立编码的全局特征难以捕捉跨模态细粒度对应关系的技术瓶颈,显著提升了视频与文本模态间的语义对齐精度。
竞赛十三
CVPR 2026 AUTOPILOT关键目标定位挑战赛”聚焦于交通事故场景下的关键目标定位任务,实现对复杂驾驶环境中关键交通参与者的精准定位。赛事基于 DADA-2000 数据集提供 近2000 个真实事故视频与图像数据,所有数据均包含配对的 RGB 视频帧、驾驶员注视图和注视点信息,并提供汽车、行人、卡车等 7 类道路参与者的边界框标注。挑战鼓励探索视觉语言模型与多模态学习在智能驾驶安全感知中的创新应用。该竞赛由美国硅谷NEC实验室、西安交通大学等机构研究人员联合主办。2025级硕士研究生“杜政霖 李正阳 文怡”和李硕博士组成的队伍获得该赛题的亚军奖项。
亚军方案:参赛队伍面向复杂驾驶场景下的关键目标定位任务,提出了一种基于大视觉语言模型的零样本感知方案。该方案以 Qwen2.5-VL-32B-Instruct 为核心,充分发挥视觉语言模型的跨模态理解能力,通过提示词引导实现目标识别与定位。在此基础上,结合视频时序信息进行连续推理,挖掘目标的时空关联特征,并设计时序一致性优化策略,融合运动分析与空间先验知识对预测结果进行校正与补全。最终,通过轻量级后处理机制进一步提升定位精度与鲁棒性,实现了复杂场景下关键目标的稳定感知与连续跟踪。该方案充分发挥大视觉语言模型的零样本推理能力,突破了传统方法对大量标注数据的依赖,为复杂交通场景关键目标定位任务提供了新方案。
竞赛十四
“CVPR 2026 EPIC-KITCHENS VISOR 半监督视频对象分割(VOS)挑战”聚焦真实厨房场景下的动态目标分割任务,要求模型仅依据首帧给定的目标标注,对后续视频中的目标进行持续、精准分割。由于目标可能经历遮挡、短暂消失与重新出现等复杂情况,同时需要排除未标注干扰对象,因此对模型的时序跟踪、遮挡推理和目标区分能力提出了较高要求。赛事基于EPIC-KITCHENS VISOR大规模第一视角厨房视频数据集,包含36小时原始无剪辑视频、27.1万人工标注语义掩码、990万AI插值生成的密集掩码,以及257类目标类别和6.7万手物交互接触标注,共计179段视频序列。本次挑战由英国布里斯托大学与意大利卡塔尼亚大学计算机视觉研究团队联合主办。由2025级硕士研究生“王英鑫、刘佳宁、任苡雯”和孙龙博士组成的队伍获得该赛题的亚军奖项。
亚军方案:队伍基于SAM 2视觉基础模型,依托其流式记忆架构与大规模预训练带来的强大先验知识,攻克了第一人称厨房场景下长视频对象分割的时序一致性难题。方案采用sam2.1-hiera-l作为初始检查点,通过轻量级微调策略,实现了模型对VISOR数据集的高效适配。团队针对性优化了推理阶段的置信度阈值,使模型在处理严重遮挡和手物交互时更为激进且稳健,同时启用延迟出现对象的追踪机制,确保了目标在长时间离开视野后仍能被准确捕捉。该方案有效攻克了第一人称视角下长视频时序分割的鲁棒性难题,显著增强了模型在严重遮挡、频繁手物交互及目标跨镜头重现等极端条件下,精准锁定初始帧标注目标并持续稳定追踪的能力。
竞赛十五
“CVPR 2026 ENACT通过世界建模实现具身认知挑战赛”旨在完成具身第一人称交互场景下的因果世界建模任务,参赛者需针对复杂的家居物理交互序列,推断未来环境状态的图像演变时序以及导致状态转移的因果动作顺序。该挑战的官方数据集为 ENACT-Challenge,基于 BEHAVIOR-1K 仿真模拟器构建,涵盖海量物理交互任务,提升了任务的时序因果复杂性与物理语义理解难度。该竞赛由美国西北大学Qineng Wang、斯坦福大学李飞飞教授等人组成的学术团队举办。由2025级硕士研究生“曹宇思、王嘉慧、陈玉英”和路小强博士组成的学生队伍获得该赛题亚军奖项。
亚军方案:队伍提出一种融合马尔可夫链迭代匹配与状态差分对齐的具身世界建模方案。该方案以InternVL3.5-8B为基础模型,将高复杂度的O(N!)全序列排序降维重构为O(N)的分步选择任务。方案通过将开发集拆解单选题进行纯16-bit精度的LoRA全线性层微调,在特征层实现高分辨率视觉Patch与占位符的精准对齐,并针对正反向任务设计了因果状态差分提示词。该方案有效缓解了传统多模态模型在长序列任务中面临的注意力稀释、多图幻觉与误差累积问题,在复杂因果场景中显著提升了具身时序排序的鲁棒性与精度。
竞赛十六
“CVPR 2026 MaCVi 多模态语义分割挑战”聚焦于利用同步的RGB、热成像及LiDAR等输入数据,实现对预测四种类别——静态障碍物、动态障碍物、水体及天空的图像分割,并且在一种或多种模态数据质量下降或缺失时仍需保持可靠性。赛事提供了用于多模态语义分割的水域场景数据集MULTIAQUA,包含日间训练/验证6000+对(RGB+热成像+LiDAR)以及夜间测试约1000+对,应对极具挑战的夜间分割任务。该竞赛由LOOKOUT公司联合创始人兼CTO Benjamin Kiefer、卢布尔雅那大学Jon Muhovič等人联合主办。由2025级硕士研究生“曹宇思、王嘉慧”和杨育婷博士组成的队伍获得该赛题亚军。
亚军方案:队伍提出了SAM+LoRA的参数高效迁移与热-雷融合的夜间鲁棒性设计方案。在现有MFNet双分支架构的基础上,引入SAM 作为共享主干网络,以RGB图像(主分支)和热成像与投影激光雷达数据拼接成的3通道辅助张量(次分支)作为双分支输入,由冻结的SAM编码器并行处理,编码器中加入可训练的LoRA低秩适配层进行参数高效微调。提取的特征经模块跨尺度融合,并由UNet风格解码器输出分割结果。该方案在仅使用有限标注数据的情况下,实现了对海事环境多模态语义分割的高效学习与推理。
竞赛十七
“CVPR 2026 通用指令视频编辑 挑战赛”旨在推动多任务、跨模态视频编辑技术的发展,参赛者需根据自然语言指令及视频内容,实现对教学视频的精准编辑,包括风格、实例、属性、数量、视觉效果以及镜头运动等多个方面。该赛题提供了一套100 个视频与文本编辑指令对,用于测试参赛模型对多样场景和复杂编辑动作的泛化能力。每个样本由原始视频与一个自然语言编辑提示词构成,参赛者需生成与提示语语义一致且在时间维度上稳定的视频输出。该挑战赛由德克萨斯农工大学、Visko平台公司和 Abaka AI平台联合组织。由2025级硕士研究生“唐颖、彭波连”和路小强博士组成的队伍获得该赛题亚军奖项。

(唐颖、彭波连、路小强)
亚军方案:团队提出了一套基于 VACE 框架的任务驱动视频编辑系统,核心采用 Wan2.1-1.3B 作为主干模型。该系统首先识别视频的全局编辑意图,然后选择最适合的控制路径进行编辑。随后,使用大模型提取帧级视觉描述,强化提示词,使其与选定的编辑分支精确对齐。系统能够在风格编辑、实例/属性/数量编辑、视觉效果编辑以及摄像机运动编辑等任务中采用不同策略。最后,团队还在输出端加入了基于 Real-ESRGAN 的超分辨率增强,以实现 1080p 的高质量交付。该系统解决了视频编辑中运动平滑与主体一致性的难题,实现了在多样化指令下高保真、稳定、可控的视频编辑智能解决方案。
竞赛十八
“CVPR 2026 VGBE挑战赛”旨在解决当前图像到视频生成任务中的外观漂移问题,研究如何在遵循文本指令生成动态视频的同时,持续保持参考图像中人物或物体的身份特征、外观细节及几何结构一致性,从而实现高保真的一致性视频生成。该挑战的官方数据集为官方发布的Image-to-Video Consistent Generation数据集,数据由参考图像和对应文本提示组成,验证阶段32个样本,最终评测阶段70个样本。该竞赛由eBay Inc.与德克萨斯农工大学联合举办。由2025级硕士研究生“周晓鹏、郭雨洁”和孙龙博士组成的队伍获得该赛题亚军奖项。

(周晓鹏、郭雨洁、孙龙)
亚军方案:队伍提出一种图像到视频一致性生成方案。该方案以Wan-2.2-5B模型为基础,结合优化提示词、优化参数及插帧技术进行改进。该方案有效缓解了视频生成中的外观漂移、身份切换和运动模糊等问题,提高了视频的身份保真度、运动连贯性和整体视觉质量。
竞赛十九
“CVPR 2026财务收据挑战赛” 聚焦于退化金融票据图像的复原与智能问答任务,要求参赛队伍在复杂背景、模糊退化、文字遮挡和票据信息不完整等条件下,恢复票据图像的可读性,并根据票据内容准确回答与时间、城市、商家、商品类别、金额计算等相关的问题。该赛题不仅考察文档图像增强与复原能力,也重点考察多模态大模型对票据信息的结构化理解、数值推理和一致性校验能力。由2025级研究生“罗蒲、许琮、李玉梅”和博士研究生“张柯欣”等组成的学生队伍获得该赛题亚军。
亚军方案:参赛队伍提出了面向金融票据理解的“图像复原—结构化问答”两阶段框架。在图像复原阶段,方案结合Grounding DINO、SAM2和DocDiff等模型,对退化票据进行定位、分割与增强修复,提升票据内容的可读性;在问答阶段,利用Qwen3.5-Plus解析问题约束并完成关键信息抽取。针对金额、税费和数量等字段易出现识别误差的问题,团队设计了一致性校验与错误修正机制,通过算术关系验证和二次核验提高结果可靠性。最终结合规则化后处理生成准确的票据问答结果。该方案将文档图像复原、多模态语义理解和确定性数值校验相结合,有效提升了复杂退化票据场景下的信息抽取与问答准确性。
竞赛二十
“NTIRE 2026 摄影修图迁移挑战赛”聚焦于基于参考图像的摄影修图迁移任务,要求参赛者根据一组修图前后参考图像,学习并提取其中蕴含的光照、色彩、对比度、局部修饰等编辑规律,并将其迁移到新的输入图像中,在保持图像内容真实性和视觉质量的同时,实现稳定、自然的自动化图像修图。赛事提供 Retouch Transfer Dataset(RTD)作为训练数据,包含 100,000 张高质量图像及 170 种专业 Adobe Lightroom 预设;测试阶段综合采用 PSNR、SSIM、LPIPS 等全参考指标及由专业影像专家参与的 MOS 主观评价进行最终排名。该竞赛由 NTIRE 2026 Workshop 组织,Omar Elezabi、Marcos V. Conde、Zongwei Wu、Yeying Jin、Radu Timofte 等人联合主办。由2025级硕士研究生“许琮、罗蒲、李玉梅”和博士研究生“柴金铭”组成的学生队伍获得该赛题亚军。
亚军方案:针对摄影修图迁移任务中参考编辑模式复杂以及全局色调与局部细节难以兼顾的问题,参赛队伍提出了一种基于双路径隐式神经表示与同步测试时增强的修图迁移算法。该方案通过坐标与图像双分支协同建模修图残差,并结合高低频特征分解,实现全局色彩迁移与局部细节保留的统一优化;同时利用同步测试时增强策略提升模型输出稳定性。该方法兼顾轻量化与高效率,最终在决赛中取得MOS评分263分、综合排名亚军的优异成绩。该方案在保持较低模型复杂度和较高推理效率的同时,实现了对参考修图风格的稳定迁移,为参考驱动的自动化摄影修图提供了一种兼顾色彩迁移、细节保持与推理稳定性的高效技术路径。
竞赛二十一
“CVPR 2026 第八届 UG2+ Workshop Track 2:恶劣天气场景语义分割挑战赛”聚焦于复杂退化条件下的户外场景语义分割任务,要求参赛者针对模糊、黑暗、雪天、雾霾、强光眩光等五类真实恶劣天气退化图像,完成道路、建筑、植被、车辆等多类别场景目标的像素级识别。该赛题面向自动驾驶、智能监控和复杂环境感知等安全关键应用,重点考察算法在小样本、多场景、强分布偏移条件下的鲁棒泛化能力。赛事提供 513 个训练场景和 38 个测试场景,数据采集自美国、日本、挪威、意大利、中国台湾、新加坡、瑞士等多个地区的固定户外摄像头,涵盖 10 类语义标注及多种真实天气退化类型。由2025级硕士研究生“许琮、罗蒲、李玉梅”和博士研究生“马芹”组成的学生队伍获得该赛题季军。
季军方案:针对恶劣天气语义分割任务中验证集与测试集性能差距较大的问题,队伍提出了一种面向复杂天气退化场景的鲁棒训练方案。该方法基于SegMAN-S模型,通过清晰图像与退化图像联合训练,并引入轻量级特征重校准模块,增强模型对稳定语义信息的表征能力。与此同时,团队设计了面向多种天气退化类型的定向增强策略,并结合多帧语义一致性融合机制,进一步提升模型在真实复杂环境中的泛化能力。最终,方案在官方测试集上取得59.9%的mIoU,相比SegFormer-B5提升10.0个百分点。该方案表明,在小样本恶劣天气语义分割任务中,合理的训练策略设计比单纯扩大模型规模更能提升模型的鲁棒泛化能力。
竞赛二十二
“EgoCross (限制基线赛道): 跨领域主视角 VQA”聚焦于跨域第一视角视频理解,要求模型能够医学手术、极限运动、动物视角、工业生产四个不同领域,推理完成957道包含动作识别、时序推理、目标定位、计数以及未来事件判断等任务的选择题,旨在评估多模态大语言模型在复杂真实场景中的感知、理解与推理能力。该竞赛上海交通大学人工智能研究院和复旦大学等机构的研究人员联合主办。由2025级硕士研究生“文怡、杜政霖、李正阳”和博士研究生“郝佳瑶”组成的学生队伍获得该赛题季军。
季军方案:季军队伍针对任务中存在的领域分布偏移严重、时序依赖复杂以及专业场景知识不足等挑战,基于Qwen3-VL-4B多模态大模型,采用双适配器LoRA结构为不同领域学习独立的参数表示,并利用数据自适应路由策略动态选择最适合当前输入场景的适配器;结合时间戳感知提示,向输入序列中引入 <time token> 显式编码视频时间信息,增强时序视频理解能力;针对医疗手术等专业领域知识不足的问题,团队引入基于Lexical RAG的知识增强模块,利用外部的结构化手术知识和视觉示例作为推理依据注入模型决策过程。该方法实现了时序信息、领域适配与知识检索的协同优化,有效提升了模型在复杂跨领域第一视角视频场景中的理解与推理能力。
竞赛二十三
“CVPR 2026 SoccerNet球行为预测竞赛”聚焦于足球比赛中的动态理解与预判能力,旨在推动视频动作预测技术在真实体育场景中的应用。比赛要求根据某个球行为发生前30秒的短视频片段,预测未来5秒内即将发生的球行为类别及其具体发生时间,并通过六个时间阈值下的平均精度均值进行综合评估。该竞赛由SoccerNet 挑战赛组委会主办。由2025级硕士研究生“赵振宇、翟子涵、李婷婷”和博士研究生“谢兴霖”组成的学生队伍获得该赛题季军。
季军方案:队伍使用FAANTRA作为基线模型,该模型的特征编码器负责提取输入视频序列的时空特征,Transformer编码器-解码器负责对提取到的特征序列进行时序建模与未来行为推理,预测头同时输出行为类别、时间偏移量和分割辅助任务结果。训练上采用多阶段策略,先在224p低分辨率数据上从头训练至初步收敛,获得稳定的基础表征能力,再加载该阶段所得权重,在720p高分辨率数据上进一步微调,以增强特征的判别能力,最终模型在挑战测试集上取得21.14的平均 mAP。该方案有效发挥了FAANTRA模型在时序依赖建模上的优势,结合多分辨率训练策略,显著提升了球行为预测的准确性与时序定位能力。
竞赛二十四
“CVPR 2026 物理感知的视频实例移除挑战赛”聚焦于真实场景下物体移除后的视频修复,要求模型不仅仅完成物体删除,还能对物体与环境的物理交互(如阴影、反射、水波纹、次级运动传播)进行建模和重新生成,确保填充内容在视觉与物理层面均与场景保持连贯。任务输入为官方提供的原始视频、文本提示和分割掩膜,输出需保持与原视频相同帧数、宽高比及不低于480p的分辨率,且必须具备时间连贯性并完美保留无关区域。该挑战旨在推动基于物理的视频操控模型发展,提供标准化评估基准。赛事由德克萨斯农工大学、Visko平台与Abaka AI联合主办。由2025级硕士研究生“曹宇思、王嘉慧、陈玉英”和博士研究生“王一晴”组成的学生队伍获得该赛题季军奖项。
季军方案:队伍提出了一种基于隐式物理效应擦除的端到端视频修复方案。该方案以EffectErase为核心,构建于视频扩散模型之上,通过视频物体移除与插入联合训练,实现目标对象及其关联环境影响的隐式擦除,无需依赖显式掩膜扩展或外部视觉语言模型。该方法有效缓解了复杂物理场景下的视频时间漂移与内容不一致问题,并能够在单张RTX 4090 GPU上稳定处理任意长度视频,最终实现兼具物理真实性、时间一致性和场景完整性的视频实例移除效果。
竞赛二十五
“CVPR 2026 海上视觉-图表数据关联挑战赛”旨在增强船舶的导航数据理解,要求参赛者研发深度学习模型,基于船载摄像头拍摄的单目图像以及附近助航设备的图表标记,实现对可见浮标的精准检测,并将其与对应的图表标记进行匹配。赛事提供包含5189个条目的数据集,每个条目包含一张RGB图像、数量不等的查询以及数量不等的标签,部分条目不含任何可见浮标。此外,赛事还提供了原始的IMU数据,供参赛者按需提取并整合到算法中,以探索更优的方案。该竞赛由LOOKOUT公司联合创始人兼CTO Benjamin Kiefer、卢布尔雅那大学Jon Muhovič等人联合主办。由2025级硕士研究生“曹宇思、王嘉慧”和孙龙博士组成的队伍获得该赛题季军奖项。
季军方案:队伍提出一种基于动态图表派生查询的检测方案,该方案以DEIMv2检测框架为基础,采用DINOv3视觉Transformer作为骨干网络,结合多尺度特征与可变形注意力机制。将原始检测器中的固定查询替换为动态的图表派生查询,解码器支持可变数量查询,并使用查询掩码忽略无效标记。此方案突破了固定查询机制无法适应可变图表标记数量的限制,解决了图表数据与视觉图像之间的跨模态关联问题。
竞赛二十六
“CVPR 2026 第四届全方位视频质量评估挑战赛”聚焦于4D世界模型生成视频的整体质量评估任务,要求构建评估视频质量、物理真实性、视频对齐性和时空一致性的自动化评价模型,定位视频中异常发生的时间片段。该赛题数据集包含1554个由7类代表性世界生成模型产生的视频,覆盖26类物理相关与开放场景内容,评估指标综合考虑质量分数预测相关性与异常时间戳定位精度,旨在推动世界模型生成结果向“物理是否合理、时序是否连贯、条件是否一致”的综合评价发展。该赛题由中国科学技术大学、EIT与清华大学联合主办。由2025级硕士研究生“李正阳、杜政霖、文怡”和李硕博士组成的队伍获得该赛题季军。
季军方案:针对世界模型生成视频中多维质量指标耦合强、物理异常时间定位难、不同视频类型与生成模型分布差异大等问题,团队提出了一种基于“类别感知特征增强、多任务质量预测与交叉验证集成”的双阶段评估方案。该方案首先采用冻结的InternVideo2视频基础模型,对输入视频进行均匀帧采样并提取高层时空语义特征;随后将视频类型和生成模型名称转化为one-hot类别特征,与视频视觉特征拼接后输入轻量化多任务预测头QualityHeadV2。该预测头通过共享MLP表征和多分支输出,同时完成四个质量维度分数回归、物理异常概率判断以及异常起止时间戳预测,实现了从“整体质量评分”到“异常片段定位”的联合建模。训练过程中,团队采用由Huber损失、二分类交叉熵损失和Smooth L1时间戳回归损失构成的联合优化目标,并通过5折交叉验证训练多个子模型,最终在测试阶段对各模型预测结果进行平均融合,提升了方法在复杂生成视频场景下的稳定性与泛化能力。该方案有效突破了传统视频质量评价方法难以识别物理违背、时序不一致和条件不匹配等问题,为4D世界模型生成结果的细粒度、可解释质量评估提供了高效可靠的技术路径。
竞赛二十七
“CVPR 2026 doScenes自动驾驶指令理解挑战赛-消融实验赛道”聚焦于自动驾驶场景中的语言引导轨迹预测任务,旨在研究自然语言指令对自动驾驶决策与轨迹规划能力的提升作用。赛事基于 doScenes 数据集开展,该数据集在自动驾驶数据集 nuScenes 基础上构建,涵盖 1000 个真实驾驶场景,并进一步引入了近4000条自然语言驾驶指令与场景目标指代标注,为自动驾驶系统的人机交互研究提供了重要基准。该竞赛由美国 Machine Intelligence and Interaction Lab研究团队组织。2025级硕士研究生“杜政霖、李正阳、文怡”和杨育婷博士组成的队伍获得该赛题季军。
季军方案:队伍围绕自动驾驶场景中的语言引导轨迹预测任务,提出了一种融合车辆运动历史与自然语言指令的轻量化预测方案。该方法结合车辆历史轨迹特征和驾驶意图信息,实现对未来运动轨迹的精准预测,并通过多模型融合策略进一步优化预测结果。实验结果表明,引入自然语言指令后,模型预测误差较基线模型降低约3.7%,验证了语言信息对自动驾驶轨迹规划任务的重要价值。该方案充分挖掘了语言与运动信息的协同价值,为自动驾驶决策规划研究提供了新的解决思路。
CVPR 2026录用论文
CVPR 2026录用论文中,第一作者分别是柴金铭博士生(导师:焦李成教授),李瑞阳博士生、张超硕士生(导师:刘芳教授),吕崇华博士生(导师:王爽教授),徐俊伟博士生(导师:董伟生教授),杨智超博士生(导师:李雷达教授),李奥博博士生、胡睿博士生与吴淞博士生(共同第一作者)、陈志文博士生(导师:吴金建教授),石光辉博士生(导师:梁雪峰教授),杨玉壮硕士生(导师:田小林教授),韩硕博士生(导师:唐旭教授),杨麒瞳硕士生(导师:冯明涛副教授)。
西安电子科技大学人工智能学院焦李成教授团队深耕遥感领域三十余载,构建了坚实的理论基础与丰富的工程实践体系,并在计算机视觉与遥感相关的多项国际顶级会议与竞赛中取得了一系列重要突破。团队长期致力于指导学生参与国内外高水平专业竞赛,屡创佳绩。围绕计算机视觉与模式识别领域的前沿挑战,团队持续探索并提出了一系列具有创新性的解决方案,在关键核心技术上实现了突破性进展。同时,依托“以赛促学”的培养机制,学生在真实任务驱动的实践过程中不断提升科研能力与学术交流水平,这一模式也已成为学院创新型人才培养体系的重要组成部分。该培养模式不仅有效促进学生对学科知识的深入理解与科研兴趣的激发,也显著强化了团队协作能力与解决复杂问题的综合素质。近年来,在 CVPR、ICCV、ECCV、IGARSS 等国际顶级会议及相关竞赛中,团队指导学生累计获得百余项冠亚季军奖项,充分体现了卓越的人才培养成效与学科建设水平。

(2025级硕士研究生合照)

(2024级硕士研究生合照)
欢迎报考西安电子科技大学人工智能学院
西安电子科技大学人工智能学院在智能科学与技术以及人工智能两个专业招收本科生。1990年成立我国第一个神经网络研究中心并开始培养人工智能领域研究生; 2005年建立智能科学与技术本科专业,培养人工智能领域本科生,形成了完整的“国际化+西电特色”的人工智能人才培养本、硕、博一体化培养体系;2017年11月,西安电子科技大学成立了教育部直属高校首个人工智能学院,是致力于人工智能领域高端人才培养、创新成果研发和高层次团队培育的实体性学院。目前,建设有智能科学与技术专业(国家级特色专业)和人工智能专业(全国首批),两个专业双双入选国家级一流本科专业建设点,并连续4年在“软科中国大学专业排名”中获评A+专业。
西安电子科技大学深耕人工智能领域30余年,先后培养了一大批本硕博人才,其中学术界工业界领军人物百余名,已构建形成“科学研究+创新实践”“高水平平台+高层次人才”“人工智能+其他学科跨界融合”的特色育人体系。学校将持续利用人工智能方面的科研和教学优势,打造人工智能领域高端人才培养基地、创新成果研发中心和示范性“人工智能+教育”标杆工程,为中国在这一高技术领域贡献西电力量。